Just another IT site ※IT系の記事は当方環境での実施内容となるため実施する場合は自己責任でお願いいたします。At Your Own Risk!! TURN BACK WHILE YOU CAN
PR

【OpenClaw】リアルタイム音声とTTS(MP3)の切り替え設定を簡潔に解説

※IT系の記事は当方環境での実施内容となるため実施する場合は自己責任でお願いいたします。スクリプトはAI生成のものも多いのでコピー&ペーストの際は文字コードに注意ください!

OpenClawのTalk Modeには、大きく分けて2つの音声方式があります。

リアルタイム音声
→ 音声モデルと直接リアルタイム会話

STT+TTS
→ 音声を文字化
→ 通常のAIへ送信
→ 返答をTTSで読み上げ

用途に応じて talk.realtime.mode を変更します。

スポンサーリンク
バッチ処理の自動化スキルは市場価値が高いです。今の自分の単価を調べてみませんか?
顧客常駐はもう嫌だ!社内SEへ転職するなら【社内SE転職ナビ】
Cursor・Claude Code・Codex AIスキルを学ぶなら
環境構築不要!AIエージェント開発を非エンジニアでも即実践【AI Agent Camp】

リアルタイム音声を使う

設定例です。

{
  talk: {
    realtime: {
      mode: "realtime",
      provider: "openai",
      transport: "gateway-relay",
      providers: {
        openai: {
          model: "gpt-realtime-2.1",
          speakerVoice: "coral"
        }
      }
    }
  }
}

Android版OpenClawでは、

mode = realtime
transport = gateway-relay

の組み合わせで利用します。

Realtimeのメリットは、

  • 応答が速い
  • 会話の間が自然
  • 割り込みに対応しやすい
  • 発音や抑揚が自然

といった点です。

一方で、音声入出力をリアルタイム処理するため、通常のテキスト+TTS構成よりAPI消費が大きくなりやすい点には注意が必要です。

TTS方式へ切り替える

通常モデル+TTSにする場合は、

{
  talk: {
    realtime: {
      mode: "stt-tts"
    }
  }
}

とします。

流れは、

音声認識
↓
通常のOpenClawエージェント
↓
TTS読み上げ

です。

Realtime専用モデルを常時使わないため、構成によってはAPIコストを抑えやすくなります。

MP3で出力する

例えばElevenLabsなら、

{
  talk: {
    provider: "elevenlabs",
    providers: {
      elevenlabs: {
        speakerVoiceId: "VOICE_ID",
        modelId: "eleven_multilingual_v2",
        outputFormat: "mp3_44100_128"
      }
    }
  }
}

のようにMP3出力を指定できます。

Realtime
→ その場の自然な音声会話

STT-TTS
→ 通常モデル
→ TTS
→ MP3など

という違いです。

API消費を抑えたいならTTS方式も有力

Realtimeは自然な会話ができる反面、

音声入力
音声理解
音声生成

を連続して処理するため、利用時間が長くなるほどAPI消費も増えやすくなります。

一方、

音声認識
↓
通常モデル
↓
TTS

という構成なら、普段使っているモデルやfallbackをそのまま利用しやすく、コスト管理もしやすくなります。

そのため、

自然な会話を最優先
→ Realtime

API消費を抑えたい
→ STT+TTS

という使い分けもできます。

MP3は英語学習との相性がよい

MP3形式で音声を残せる構成は、英語学習にも向いています。

例えばAIに、

今日使える英会話フレーズを10個作って
英語 → 日本語 → 英語の順で読んで

と依頼し、TTSでMP3化すれば、

通勤中に聞く
↓
繰り返し再生
↓
シャドーイング
↓
発音確認

といった使い方ができます。

Realtimeは「会話練習」に向いていますが、MP3は、

  • 同じ文章を何度も聞く
  • シャドーイングする
  • 聞き流す
  • 学習教材として保存する
  • 発音を繰り返し確認する

といった用途に向いています。

英語学習なら両方使い分ける

英語学習では、

Realtime
→ AIとの英会話練習

MP3/TTS
→ 復習・聞き流し・シャドーイング

という使い分けが便利です。

例えば、

1. Realtimeで10分英会話
2. 間違えた表現をAIに整理してもらう
3. 正しい例文をTTSでMP3化
4. 後から繰り返し聞く

という流れにすると、会話練習と復習を組み合わせられます。

リアルタイムとTTSの切り替え

リアルタイム音声

mode: "realtime"

Androidでは、

transport: "gateway-relay"

も指定します。

通常モデル+TTS

mode: "stt-tts"

です。

まとめ

OpenClawの音声は、

Realtime
→ 自然な会話
→ API消費は大きくなりやすい

STT+TTS
→ 通常モデルを利用
→ コスト管理しやすい
→ MP3保存とも相性がよい

という違いがあります。

特に英語学習では、

Realtimeは英会話練習、MP3は復習やシャドーイング

と使い分けると便利です。

自然な会話を楽しみたいときはRealtime、長時間利用や繰り返し学習ではTTS/MP3、という使い分けが実用的です。

タイトルとURLをコピーしました