タグアーカイブ 音声AI

OpenAIが解説、GPT-Liveのリアルタイム音声AI基盤 6か月で会話応答を実現へ

OpenAIが解説、GPT-Liveのリアルタイム音声AI基盤 6か月で会話応答を実現へ

OpenAIが2026年8月、新たな音声AIシステム「GPT‑Live」の設計を解説するブログ記事を公開した。同社の音声AIは、従来のターンベースからフルデュプレックスへと進化し、人が会話で無意識に行う「間」の制御を大幅に改善したという。わずか6か月で実用化にこぎつけたその裏側には、ストリーミング推論、状態管理、プロトコル最適化といった多層的な技術的挑戦があった。

本記事では、このブログで語られたGPT‑Liveのシステム設計に焦点を当てる。なぜ従来の音声応答では違和感が残ったのか、そしてどのようにして「息の合った」会話をスケールさせたのかを、具体的な設計上の工夫とともに紹介する。

ターンベースの限界、なぜ音声AIは「間」に弱いのか

ターンベースの限界、なぜ音声AIは「間」に弱いのか

人間同士の会話では、わずか0.5秒以下の間で話者交替が行われる。しかし従来の音声AIはテキスト向けLLMの流れを引き継ぎ、音声をテキストに変換し、推論してから音声を合成するという逐次処理が基本だった。スピーチトゥスピーチモデルの登場で音声を直接扱えるようになったが、依然として「発話が終わったか」を判断する小さなターン検出器に依存していた。

この検出器はジレンマを抱える。早すぎる判断はユーザの言葉を遮り、遅すぎる判断は応答の間延びを生む。しかも検出器の判断後に大規模なLLMが起動するため、応答までの遅延は避けられなかった。

OpenAIのブログ記事では、この課題を「誰がいつ話すかを決める小さなモデルに会話のリズムを委ねることは非効率だった」と指摘している。

従来のターンベースモデル(Before)
ユーザ発話 音声入力 ターン検出器 判断待ち LLM推論 応答生成
※検出器の誤判定による遮断や遅延が発生
GPT‑Liveのフルデュプレックス(After)
ユーザ発話 音声ストリーム ⇄ 同時送受信 ⇄ 音声モデル 即時応答
※検出器不要、発話中も相手の音声を聞きながら応答を生成

上の図のように、GPT‑Liveはターン検出器を音声パスから完全に排除した。音声の送受信を同時に行うフルデュプレックス方式により、会話の流れが途切れず、より自然なやり取りを実現している。

GPT‑Liveの中核、フルデュプレックスと非同期委任の仕組み

GPT‑Liveでは、音声そのものを処理する経路と、より深い思考やツール実行を担う経路を意図的に分離している。会話のリアルタイム性を支える「メディア高速パス」と、大規模なフロンティアモデルGPT‑5.5を呼び出す「アプリケーション低速パス」だ。音声モデルは常に会話を続けながら、必要に応じて非同期RPCでGPT‑5.5に委任する。これにより、たとえ委任先の応答に時間がかかっても、音声の流れが止まることはない。

この分離設計は、機能拡張の面でも恩恵が大きい。アプリケーション側のツールやポリシーを変更しても、音声応答の核となるメディアパスに影響を与えずに済む。今後、ChatGPTのデスクトップアプリでコンピュータ操作やエージェント連携といった新機能を追加する際も、音声体験の即時性を犠牲にしない基盤がすでに整っている。

システム全体の流れ
クライアント 音声入出力 音声モデル フルデュプレックス推論
メディア高速パス
途切れのない音声フレーム配送
アプリケーションサーバ 非同期RPC GPT‑5.5 ツール・推論
アプリケーション低速パス
深い思考やツール実行をバックグラウンドで処理
重要な設計方針
音声モデルは会話を途切れさせず、必要に応じてフロンティアモデルに委任する。委任の結果が遅れても、音声パスには影響しない。

途切れない音声を保つ、推論基盤の最適化

途切れない音声を保つ、推論基盤の最適化

フルデュプレックスの会話をスケールさせるには、ステートフルな推論と動的なコンテクスト管理が欠かせない。音声セッションは長時間に及び、その間コンテクストが増え続ける。モデルインスタンスも需要に応じて増減するため、途切れのない体験を維持するには高度なハンドオフ機構が必要になる。

GPT‑Liveは、モデルインスタンス間のシームレスな切り替えを導入した。切り替えが必要な場合、既存のインスタンスと並行して新しいインスタンスを立ち上げ、現在のセッションコンテクストを事前に読み込ませる。両方のインスタンスで推論を並行して行い、新しいインスタンスの準備が整った時点で切り替える。この一連の処理はメディアパスの外側で実行されるため、会話が中断される心配はない。

同様に、コンテクストがモデルの上限を超えた場合も、同じ並行ハンドオフの考え方で対応する。従来は推論を止めてコンテクストを圧縮し、KVキャッシュを再構築する必要があったが、GPT‑Liveでは圧縮作業と新インスタンスの準備をバックグラウンドで行う。元のインスタンスが会話を続けている間に、圧縮済みコンテクストを持った代替インスタンスが準備され、問題なく切り替えられる。この仕組みにより、長時間の通話でも音声が途切れず、ユーザはコンテクストの上限を意識することがない。

従来の対応(Before)
長い会話でコンテクストが上限に達すると、推論を止めて圧縮処理を実行。KVキャッシュが破棄され、再構築に遅延が発生。
STEP 1 コンテクスト上限到達
STEP 2 推論一時停止 圧縮処理
※この間音声が途切れる
GPT‑Liveの動的コンパクション(After)
既存のインスタンスが会話を続ける裏で、新しいインスタンスを準備し、圧縮済みコンテクストを事前投入。準備完了後に切り替える。
STEP 1 代替インスタンス生成
STEP 2 圧縮コンテクストを事前読込
STEP 3 並行推論で追いついたら切替
※会話は一切止まらない

起動遅延を1回のUDPパケットに、プロトコル改善の舞台裏

起動遅延を1回のUDPパケットに、プロトコル改善の舞台裏

音声AIの応答速度は、会話の開始ボタンを押した瞬間から問われる。GPT‑Liveでは、WebRTCをベースにメディアパスを確立し、モデルへの音声入力を開始するまでの時間を極限まで削り取った。そのために生み出されたのが、WARP(WebRTC Abridged Roundtrip Protocol)とInstant Connectという2つの新技術だ。

標準的なWebRTCでは、メディアとデータの開始までにICE、DTLS、SCTP、データチャネルの確立と、最大6回のネットワーク往復が必要だった。OpenAIのエンジニアは、DTLSハンドシェイクをICEに便乗させるSPEDや、SCTPのネゴシエーションを事前共有するSNAPなどを考案し、これらの手順を1往復に圧縮した。さらにInstant Connectにより、SDPパラメータの事前共有を実現。ユーザがボタンを押した瞬間、最初のUDPパケットでセッションが成立し、即座に音声ストリームが流れ始める。

従来のWebRTCハンドシェイク(Before)
メディアとデータの開始までに最大6往復の通信が必要。
1往復目 ICE疎通確認
2往復目 DTLSハンドシェイク
3往復目 SCTPアソシエーション
4〜6往復目 データチャネル確立
※接続完了まで数百ミリ秒
WARPとInstant Connectによる最適化(After)
事前にSDPネゴシエーションを行い、1つのUDPパケットでセッション開始。
1パケット送信 ICE+DTLS+SCTP+データチャネルを一回の往復で確立
※接続時間を大幅短縮、実質ワンラウンドトリップ

これらのプロトコル改良は、OpenAIだけでなくWebRTCコミュニティにも公開されており、すでにlibwebrtcやPionに実装が進んでいる。IETFのTSVWGワーキンググループを通じて標準化も目指されているという。

本番さながらのテストが教えた教訓

本番さながらのテストが教えた教訓

理論上の性能がいくら優れていても、実際の音声トラフィックの前では想定外のボトルネックが顔を出す。OpenAIはGPT‑Liveの本格提供前に、サイレントシャドーテストと呼ばれる手法を採用した。ChatGPT Voiceの実際のユーザセッションの一部を、既存のAdvanced Voice Modeと並行して、新しいシステムに読み取り専用で流し込むのだ。

このテストで最初に判明したのは、GPUの処理能力だけを見ていては不十分だという事実だった。音声セッションは継続的にフレームを送り続けるため、CPU側のストリームハンドラやキュー、ネットワーク経路もGPUと同等にスケールしなければならない。サイレントテストにより、負荷試験では見落とされがちなCPU飽和が検出され、レイテンシの蓄積を防ぐ対策が取られた。

一般的な負荷テスト(Before)
  • GPUあたりのリクエスト数だけを見る
  • 長時間接続や再接続のパターンを検証できない
  • 地理的な遅延差が考慮されない
※本番で想定外のボトルネックが発生しがち
GPT‑Liveのサイレントシャドーテスト(After)
  • 実際のユーザーの音声セッションを読み取り専用で流す
  • CPU側のストリーム処理やネットワーク経路も含めて検証
  • 地域別の遅延や長時間の状態圧縮の挙動を観測
※本番と同等の負荷と多様性で問題を早期発見できる

また地理的な要素も無視できない教訓をもたらした。ユーザに近い場所に推論リソースを配置しなければ、起動時やストリーミング中の遅延が増加する。OpenAIは地域別の容量とトラフィック誘導を定常的に検証し、エンドツーエンドの応答性を部品ごとに可視化する監視体制を整えた。さらに、メトリクスの粒度を上げ、ダッシュボードが不健全なエンジンを埋もれさせないように改善。段階的なロールアウトやパスの隔離など、本番品質を支える運用技術も同時に鍛え上げられた。

この記事のポイント

  • GPT‑Liveはターン検出器を排除したフルデュプレックス方式で、発話中の同時送受信を実現
  • 音声モデルとフロンティアモデルを非同期に分離し、深い思考を会話の遅延なく組み込む設計
  • ステートフル推論と動的コンパクションにより、長時間の会話でも途切れない音声を維持
  • WebRTCのハンドシェイクを1往復に圧縮するWARPやInstant Connectで、起動遅延を極限まで低減
  • 本番トラフィックを使ったサイレントテストで、実際の運用に耐えるシステムへと練り上げた
OpenAI、フルデュプレックス音声モデルGPT‑Liveを発表、会話の自然さを大幅向上

OpenAI、フルデュプレックス音声モデルGPT‑Liveを発表、会話の自然さを大幅向上

OpenAIは2026年7月8日、新しい音声対話モデル「GPT‑Live」を発表した。人が話しかけるのと同時に聞き取り、相槌を打ったり沈黙を尊重したりできるフルデュプレックスアーキテクチャが最大の特徴だ。

モデル自体は単体の音声モデルでありながら、高度な質問に対してはバックエンドのGPT‑5.5に自動で推論を委譲する。これにより、速さと知性を両立させた自然な会話体験を実現している。

フルデュプレックスアーキテクチャが会話の自然さを変える

フルデュプレックスアーキテクチャが会話の自然さを変える

従来の音声AIが抱えていた限界

これまでのChatGPT音声機能は、大きく分けて2つの方式を経て進化してきた。最初のカスケード型は、音声認識→テキスト生成→音声合成という3つのモデルを直列に繋いでいた。各段階で情報が欠落し、応答までに長い沈黙が生まれる欠点があった。

次世代のターンベース型(Advanced Voice Mode)は単一モデルで音声を処理し、レイテンシを削減した。しかし「ユーザーが話し終えるまで待つ」というターン制のため、割り込みや考え込む間といった自然なやり取りができず、わずかな無音で誤って応答を開始する問題も残っていた。

従来のカスケード型音声システム(Before)
ユーザー発話 音声認識 LLM応答生成 音声合成
情報がモデル間で欠落し、応答が遅く不自然。長い沈黙とぎこちないやり取り。
GPT‑Liveのフルデュプレックス連続対話(After)
ユーザー発話 GPT‑Live(同時入出力)
リアルタイムに聞きながら話す。「うん」「なるほど」で相槌し、考え中の無音も尊重。
ユーザー側  単一の音声モデル  複数モデルの連鎖(カスケード)

このデモはGPT‑Liveがもつ同時双方向処理の概念を簡略化したものだ。実際の会話では秒単位で割り込みやツール呼び出しの判断が行われている。

連続的な相互作用が生むリアルタイム性

GPT‑Liveのフルデュプレックス構造では、入力と出力が同時に連続的に処理される。モデルは1秒間に何度も発話や傾聴、一時停止、割り込み、ツール起動といった行動を判断できる。この仕組みが、相槌や「ええ」といった自然なフィードバック、沈黙の尊重、さらには会話中のリアルタイム翻訳まで可能にしている。

バックエンド委譲で高度な推論をリアルタイム対話に統合

バックエンド委譲で高度な推論をリアルタイム対話に統合

対話と思考の分離がもたらすメリット

GPT‑Liveはフロントエンドの自然な対話と、バックエンドの深い処理を分離した。Web検索や複雑な推論が必要な質問が来ると、自身は会話を続けながらGPT‑5.5にタスクを委譲する。回答が用意でき次第、会話に自然に織り込まれる。

この分離により、常に最新のフロンティアモデルが活用され、モデル更新のたびにGPT‑Liveの知性も自動的に向上する。発表時点ではGPT‑5.5がバックエンドとして使われる。

STEP 1 ユーザーが「最も売れたSF小説のあらすじを教えて」と質問
STEP 2 GPT‑Liveが「それなら、ちょっと調べてくるね」と会話を続ける
STEP 3 バックグラウンドでGPT‑5.5がWeb検索と推論を実行
STEP 4 結果が返ると、GPT‑Liveが自然に会話に織り交ぜて回答
STEP1ユーザーの発話
STEP2GPT‑Liveの即時返答
STEP3GPT‑5.5による深い処理
STEP4会話へ統合

この委譲の仕組みにより、GPT‑Liveは会話のテンポを保ちつつ、最新のフロンティアモデルの知性を引き出せる。

評価指標が示す会話品質の飛躍的向上

評価指標が示す会話品質の飛躍的向上

人間による比較評価でAdvanced Voice Modeを圧倒

OpenAIの発表によれば、5〜10分の会話を対象にした人間評価では、GPT‑Live‑1とGPT‑Live‑1 miniの両方がAdvanced Voice Modeより強く選好された。話者交替のスムーズさ、割り込みの自然さ、会話全体の心地よさで高い評価を得ている。

専門的な推論力を測るGPQA(物理学・化学・生物学の高度な質問)ではGPT‑Live‑1が大幅に上回り、Web検索能力を問うBrowseCompでも強い改善を見せた。音声エージェントとしての電話サポートタスクでも、内部指標でAdvanced Voice Modeを凌駕した。

ChatGPT Voiceに搭載される新機能と使い勝手

ChatGPT Voiceに搭載される新機能と使い勝手

相槌や割り込み、視覚的応答の追加

GPT‑Liveの導入により、ChatGPTの音声ボタンを押すとすぐに自然な会話が始まる。ユーザーは質問を遮ったり、考え込む間を作ったり、「ゆっくり話して」と頼んだりできる。モデルは「うん」「なるほど」といった相槌で話を聞いていることを伝え、背景ノイズがあっても話者の声に集中する。

さらに、天気や株価、スポーツの試合予定などの情報は、音声会話中にビジュアルカードとして画面に表示される。従来通り画像やファイルのアップロードにも対応し、Web検索やメモリー機能とも連携する。

回答の思考深度も選択可能で、「Instant」なら即答、「Medium」や「High」にするとモデルが時間をかけて深く推論する。全9種類の声もGPT‑Live向けにリマスターされた。

音声特化の安全性設計と継続的な監視

音声特化の安全性設計と継続的な監視

リアルタイムの有害出力検出と介入

GPT‑Liveは音声会話の即時性に対応するため、発話中でも安全性チェックが動作する。不適切な内容が検出されると、より安全な応答へ誘導したり、追加の安全メッセージを表示したり、深刻なケースでは会話を終了させたりする。

自傷行為に関する会話では、専門家が確認したクライシスヘルプライン情報を音声で案内する仕組みも組み込まれた。10代のユーザー向けには年齢に適した振る舞いを直接モデルに学習させ、保護者がChatGPT Voiceの利用を制限できる機能も用意されている。

実利用データに基づく安全対策の進化

OpenAIは感情的な依存に関する長期モニタリングを展開し、実際の利用パターンから新たなリスクを特定して対策を強化する方針だ。音声のなりすましを防ぐため、GPT‑LiveはChatGPTに用意された定義済みの声のみを使用し、実在の人物の声を模倣しないように設計されている。

この記事のポイント

  • GPT‑Liveはフルデュプレックス構造で同時に聞きながら話し、相槌や沈黙を自然に扱える音声モデル
  • 高度な質問はバックエンドのGPT‑5.5に自動委譲し、会話のテンポを保ったまま深い推論結果を返す
  • 人間評価やGPQAなどのベンチマークでAdvanced Voice Modeを大きく上回る会話品質と知性を達成
  • ChatGPT Voiceに即日導入され、ビジュアル応答や思考深度の選択が可能に
  • リアルタイムの安全性介入や利用後監視により、音声ならではのリスクに対処している