OpenClawのTalk Modeには、大きく分けて2つの音声方式があります。
リアルタイム音声
→ 音声モデルと直接リアルタイム会話
STT+TTS
→ 音声を文字化
→ 通常のAIへ送信
→ 返答をTTSで読み上げ
用途に応じて talk.realtime.mode を変更します。
リアルタイム音声を使う
設定例です。
{
talk: {
realtime: {
mode: "realtime",
provider: "openai",
transport: "gateway-relay",
providers: {
openai: {
model: "gpt-realtime-2.1",
speakerVoice: "coral"
}
}
}
}
}
Android版OpenClawでは、
mode = realtime
transport = gateway-relay
の組み合わせで利用します。
Realtimeのメリットは、
- 応答が速い
- 会話の間が自然
- 割り込みに対応しやすい
- 発音や抑揚が自然
といった点です。
一方で、音声入出力をリアルタイム処理するため、通常のテキスト+TTS構成よりAPI消費が大きくなりやすい点には注意が必要です。
TTS方式へ切り替える
通常モデル+TTSにする場合は、
{
talk: {
realtime: {
mode: "stt-tts"
}
}
}
とします。
流れは、
音声認識
↓
通常のOpenClawエージェント
↓
TTS読み上げ
です。
Realtime専用モデルを常時使わないため、構成によってはAPIコストを抑えやすくなります。
MP3で出力する
例えばElevenLabsなら、
{
talk: {
provider: "elevenlabs",
providers: {
elevenlabs: {
speakerVoiceId: "VOICE_ID",
modelId: "eleven_multilingual_v2",
outputFormat: "mp3_44100_128"
}
}
}
}
のようにMP3出力を指定できます。
Realtime
→ その場の自然な音声会話
STT-TTS
→ 通常モデル
→ TTS
→ MP3など
という違いです。
API消費を抑えたいならTTS方式も有力
Realtimeは自然な会話ができる反面、
音声入力
音声理解
音声生成
を連続して処理するため、利用時間が長くなるほどAPI消費も増えやすくなります。
一方、
音声認識
↓
通常モデル
↓
TTS
という構成なら、普段使っているモデルやfallbackをそのまま利用しやすく、コスト管理もしやすくなります。
そのため、
自然な会話を最優先
→ Realtime
API消費を抑えたい
→ STT+TTS
という使い分けもできます。
MP3は英語学習との相性がよい
MP3形式で音声を残せる構成は、英語学習にも向いています。
例えばAIに、
今日使える英会話フレーズを10個作って
英語 → 日本語 → 英語の順で読んで
と依頼し、TTSでMP3化すれば、
通勤中に聞く
↓
繰り返し再生
↓
シャドーイング
↓
発音確認
といった使い方ができます。
Realtimeは「会話練習」に向いていますが、MP3は、
- 同じ文章を何度も聞く
- シャドーイングする
- 聞き流す
- 学習教材として保存する
- 発音を繰り返し確認する
といった用途に向いています。
英語学習なら両方使い分ける
英語学習では、
Realtime
→ AIとの英会話練習
MP3/TTS
→ 復習・聞き流し・シャドーイング
という使い分けが便利です。
例えば、
1. Realtimeで10分英会話
2. 間違えた表現をAIに整理してもらう
3. 正しい例文をTTSでMP3化
4. 後から繰り返し聞く
という流れにすると、会話練習と復習を組み合わせられます。
リアルタイムとTTSの切り替え
リアルタイム音声
mode: "realtime"
Androidでは、
transport: "gateway-relay"
も指定します。
通常モデル+TTS
mode: "stt-tts"
です。
まとめ
OpenClawの音声は、
Realtime
→ 自然な会話
→ API消費は大きくなりやすい
STT+TTS
→ 通常モデルを利用
→ コスト管理しやすい
→ MP3保存とも相性がよい
という違いがあります。
特に英語学習では、
Realtimeは英会話練習、MP3は復習やシャドーイング
と使い分けると便利です。
自然な会話を楽しみたいときはRealtime、長時間利用や繰り返し学習ではTTS/MP3、という使い分けが実用的です。
