タグアーカイブ WebRTC

OpenAIが解説、GPT-Liveのリアルタイム音声AI基盤 6か月で会話応答を実現へ

OpenAIが解説、GPT-Liveのリアルタイム音声AI基盤 6か月で会話応答を実現へ

OpenAIが2026年8月、新たな音声AIシステム「GPT‑Live」の設計を解説するブログ記事を公開した。同社の音声AIは、従来のターンベースからフルデュプレックスへと進化し、人が会話で無意識に行う「間」の制御を大幅に改善したという。わずか6か月で実用化にこぎつけたその裏側には、ストリーミング推論、状態管理、プロトコル最適化といった多層的な技術的挑戦があった。

本記事では、このブログで語られたGPT‑Liveのシステム設計に焦点を当てる。なぜ従来の音声応答では違和感が残ったのか、そしてどのようにして「息の合った」会話をスケールさせたのかを、具体的な設計上の工夫とともに紹介する。

ターンベースの限界、なぜ音声AIは「間」に弱いのか

ターンベースの限界、なぜ音声AIは「間」に弱いのか

人間同士の会話では、わずか0.5秒以下の間で話者交替が行われる。しかし従来の音声AIはテキスト向けLLMの流れを引き継ぎ、音声をテキストに変換し、推論してから音声を合成するという逐次処理が基本だった。スピーチトゥスピーチモデルの登場で音声を直接扱えるようになったが、依然として「発話が終わったか」を判断する小さなターン検出器に依存していた。

この検出器はジレンマを抱える。早すぎる判断はユーザの言葉を遮り、遅すぎる判断は応答の間延びを生む。しかも検出器の判断後に大規模なLLMが起動するため、応答までの遅延は避けられなかった。

OpenAIのブログ記事では、この課題を「誰がいつ話すかを決める小さなモデルに会話のリズムを委ねることは非効率だった」と指摘している。

従来のターンベースモデル(Before)
ユーザ発話 音声入力 ターン検出器 判断待ち LLM推論 応答生成
※検出器の誤判定による遮断や遅延が発生
GPT‑Liveのフルデュプレックス(After)
ユーザ発話 音声ストリーム ⇄ 同時送受信 ⇄ 音声モデル 即時応答
※検出器不要、発話中も相手の音声を聞きながら応答を生成

上の図のように、GPT‑Liveはターン検出器を音声パスから完全に排除した。音声の送受信を同時に行うフルデュプレックス方式により、会話の流れが途切れず、より自然なやり取りを実現している。

GPT‑Liveの中核、フルデュプレックスと非同期委任の仕組み

GPT‑Liveでは、音声そのものを処理する経路と、より深い思考やツール実行を担う経路を意図的に分離している。会話のリアルタイム性を支える「メディア高速パス」と、大規模なフロンティアモデルGPT‑5.5を呼び出す「アプリケーション低速パス」だ。音声モデルは常に会話を続けながら、必要に応じて非同期RPCでGPT‑5.5に委任する。これにより、たとえ委任先の応答に時間がかかっても、音声の流れが止まることはない。

この分離設計は、機能拡張の面でも恩恵が大きい。アプリケーション側のツールやポリシーを変更しても、音声応答の核となるメディアパスに影響を与えずに済む。今後、ChatGPTのデスクトップアプリでコンピュータ操作やエージェント連携といった新機能を追加する際も、音声体験の即時性を犠牲にしない基盤がすでに整っている。

システム全体の流れ
クライアント 音声入出力 音声モデル フルデュプレックス推論
メディア高速パス
途切れのない音声フレーム配送
アプリケーションサーバ 非同期RPC GPT‑5.5 ツール・推論
アプリケーション低速パス
深い思考やツール実行をバックグラウンドで処理
重要な設計方針
音声モデルは会話を途切れさせず、必要に応じてフロンティアモデルに委任する。委任の結果が遅れても、音声パスには影響しない。

途切れない音声を保つ、推論基盤の最適化

途切れない音声を保つ、推論基盤の最適化

フルデュプレックスの会話をスケールさせるには、ステートフルな推論と動的なコンテクスト管理が欠かせない。音声セッションは長時間に及び、その間コンテクストが増え続ける。モデルインスタンスも需要に応じて増減するため、途切れのない体験を維持するには高度なハンドオフ機構が必要になる。

GPT‑Liveは、モデルインスタンス間のシームレスな切り替えを導入した。切り替えが必要な場合、既存のインスタンスと並行して新しいインスタンスを立ち上げ、現在のセッションコンテクストを事前に読み込ませる。両方のインスタンスで推論を並行して行い、新しいインスタンスの準備が整った時点で切り替える。この一連の処理はメディアパスの外側で実行されるため、会話が中断される心配はない。

同様に、コンテクストがモデルの上限を超えた場合も、同じ並行ハンドオフの考え方で対応する。従来は推論を止めてコンテクストを圧縮し、KVキャッシュを再構築する必要があったが、GPT‑Liveでは圧縮作業と新インスタンスの準備をバックグラウンドで行う。元のインスタンスが会話を続けている間に、圧縮済みコンテクストを持った代替インスタンスが準備され、問題なく切り替えられる。この仕組みにより、長時間の通話でも音声が途切れず、ユーザはコンテクストの上限を意識することがない。

従来の対応(Before)
長い会話でコンテクストが上限に達すると、推論を止めて圧縮処理を実行。KVキャッシュが破棄され、再構築に遅延が発生。
STEP 1 コンテクスト上限到達
STEP 2 推論一時停止 圧縮処理
※この間音声が途切れる
GPT‑Liveの動的コンパクション(After)
既存のインスタンスが会話を続ける裏で、新しいインスタンスを準備し、圧縮済みコンテクストを事前投入。準備完了後に切り替える。
STEP 1 代替インスタンス生成
STEP 2 圧縮コンテクストを事前読込
STEP 3 並行推論で追いついたら切替
※会話は一切止まらない

起動遅延を1回のUDPパケットに、プロトコル改善の舞台裏

起動遅延を1回のUDPパケットに、プロトコル改善の舞台裏

音声AIの応答速度は、会話の開始ボタンを押した瞬間から問われる。GPT‑Liveでは、WebRTCをベースにメディアパスを確立し、モデルへの音声入力を開始するまでの時間を極限まで削り取った。そのために生み出されたのが、WARP(WebRTC Abridged Roundtrip Protocol)とInstant Connectという2つの新技術だ。

標準的なWebRTCでは、メディアとデータの開始までにICE、DTLS、SCTP、データチャネルの確立と、最大6回のネットワーク往復が必要だった。OpenAIのエンジニアは、DTLSハンドシェイクをICEに便乗させるSPEDや、SCTPのネゴシエーションを事前共有するSNAPなどを考案し、これらの手順を1往復に圧縮した。さらにInstant Connectにより、SDPパラメータの事前共有を実現。ユーザがボタンを押した瞬間、最初のUDPパケットでセッションが成立し、即座に音声ストリームが流れ始める。

従来のWebRTCハンドシェイク(Before)
メディアとデータの開始までに最大6往復の通信が必要。
1往復目 ICE疎通確認
2往復目 DTLSハンドシェイク
3往復目 SCTPアソシエーション
4〜6往復目 データチャネル確立
※接続完了まで数百ミリ秒
WARPとInstant Connectによる最適化(After)
事前にSDPネゴシエーションを行い、1つのUDPパケットでセッション開始。
1パケット送信 ICE+DTLS+SCTP+データチャネルを一回の往復で確立
※接続時間を大幅短縮、実質ワンラウンドトリップ

これらのプロトコル改良は、OpenAIだけでなくWebRTCコミュニティにも公開されており、すでにlibwebrtcやPionに実装が進んでいる。IETFのTSVWGワーキンググループを通じて標準化も目指されているという。

本番さながらのテストが教えた教訓

本番さながらのテストが教えた教訓

理論上の性能がいくら優れていても、実際の音声トラフィックの前では想定外のボトルネックが顔を出す。OpenAIはGPT‑Liveの本格提供前に、サイレントシャドーテストと呼ばれる手法を採用した。ChatGPT Voiceの実際のユーザセッションの一部を、既存のAdvanced Voice Modeと並行して、新しいシステムに読み取り専用で流し込むのだ。

このテストで最初に判明したのは、GPUの処理能力だけを見ていては不十分だという事実だった。音声セッションは継続的にフレームを送り続けるため、CPU側のストリームハンドラやキュー、ネットワーク経路もGPUと同等にスケールしなければならない。サイレントテストにより、負荷試験では見落とされがちなCPU飽和が検出され、レイテンシの蓄積を防ぐ対策が取られた。

一般的な負荷テスト(Before)
  • GPUあたりのリクエスト数だけを見る
  • 長時間接続や再接続のパターンを検証できない
  • 地理的な遅延差が考慮されない
※本番で想定外のボトルネックが発生しがち
GPT‑Liveのサイレントシャドーテスト(After)
  • 実際のユーザーの音声セッションを読み取り専用で流す
  • CPU側のストリーム処理やネットワーク経路も含めて検証
  • 地域別の遅延や長時間の状態圧縮の挙動を観測
※本番と同等の負荷と多様性で問題を早期発見できる

また地理的な要素も無視できない教訓をもたらした。ユーザに近い場所に推論リソースを配置しなければ、起動時やストリーミング中の遅延が増加する。OpenAIは地域別の容量とトラフィック誘導を定常的に検証し、エンドツーエンドの応答性を部品ごとに可視化する監視体制を整えた。さらに、メトリクスの粒度を上げ、ダッシュボードが不健全なエンジンを埋もれさせないように改善。段階的なロールアウトやパスの隔離など、本番品質を支える運用技術も同時に鍛え上げられた。

この記事のポイント

  • GPT‑Liveはターン検出器を排除したフルデュプレックス方式で、発話中の同時送受信を実現
  • 音声モデルとフロンティアモデルを非同期に分離し、深い思考を会話の遅延なく組み込む設計
  • ステートフル推論と動的コンパクションにより、長時間の会話でも途切れない音声を維持
  • WebRTCのハンドシェイクを1往復に圧縮するWARPやInstant Connectで、起動遅延を極限まで低減
  • 本番トラフィックを使ったサイレントテストで、実際の運用に耐えるシステムへと練り上げた