タグアーカイブ 人工知能

GPT-5.6ファミリー登場、Sol・Terra・Lunaの全容と実務メリット

GPT-5.6ファミリー登場、Sol・Terra・Lunaの全容と実務メリット

OpenAIは2026年7月9日、次世代フラッグシップモデル「GPT-5.6」ファミリーを一般提供開始した。プレビュー期間を経て投入された本リリースには、フラッグシップのSol、バランスモデルのTerra、コスト効率重視のLunaの3モデルが揃う。

GPT-5.6 Solはコーディング、知識労働、サイバーセキュリティ、科学研究の各領域で従来のフロンティアモデルを上回る性能を達成しつつ、消費トークン数と推定コストの大幅削減を両立した。これにより同一予算でもより多くの成果を出せる、いわば「コストパフォーマンスの再定義」を実現している。

この記事では、GPT-5.6の各モデルの特徴と性能、実務者にとってのメリット、そしてOpenAIが打ち出した新たな安全性対策を掘り下げる。

GPT-5.6ファミリーの全体像~3モデルの違いと狙い

GPT-5.6ファミリーの全体像~3モデルの違いと狙い
Sol(フラッグシップ)
コーディング・科学研究・サイバーセキュリティで最高性能。ultra設定で並列エージェント駆動も可能
Terra(バランスモデル)
GPT-5.5に匹敵する性能を低コストで提供。日常業務向けの実用的選択肢
Luna(コスト効率重視)
GPT-5.5のピーク性能に迫りつつ推定コストは半分未満。大量の定常タスクに最適
Sol  Terra  Luna

GPT-5.6ファミリーは3つのモデルで構成される。Sol・Terra・Lunaはいずれも第5.6世代の基盤技術を共有するが、ターゲットとする用途とコスト構造が異なる。OpenAIによれば、これらのモデル名(Sol・Terra・Luna)は永続的な能力階層を示しており、今後それぞれのペースでアップデートが進む見込みだ。

Solが実現する「1トークンあたりの仕事量」の進化

Solの最大の特徴は、消費トークンあたりの実用成果の高さにある。Agents’ Last Exam(55分野の長時間ワークフロー評価)ではスコア53.6を記録し、競合のClaude Fable 5を13.1ポイント上回った。中程度の推論設定でも、Fable 5に対して11.4ポイント優位に立ちつつ、推定コストは約4分の1に抑えている。

この効率性は下位モデルにも波及している。GPT-5.6 TerraとLunaは、Fable 5の性能を上回りながら推定コストは約16分の1だ。単に「強いAI」を作るだけでなく、同じ予算でより多くの知的作業をこなせる点が、今回のリリースの中核的価値といえる。

ultra設定がもたらす並列エージェント駆動

GPT-5.6 Solには「ultra」と呼ばれる最高能力設定が搭載された。ultraはデフォルトで4つのエージェントを並列動作させ、複雑なタスクを複数のワークストリームに分割して処理する。これにより単一エージェント構成と比べて、スコアとレイテンシの両方で改善が確認されている。

BrowseComp、SEC-Bench Pro、Terminal-Bench 2.1の3評価すべてで、並列エージェントの追加により「より高スコアをより短時間で」達成する結果が得られた。開発者はAPIのマルチエージェントベータ機能を通じて、同様の並列処理を独自に構築することも可能だ。

実務者にとってのGPT-5.6~コストと速度の再定義

実務者にとってのGPT-5.6~コストと速度の再定義
開発者 GPT-5.6に指示 GPT-5.6 Sol 必要な中間処理を自動選別 完成度の高い成果物を短時間で納品

GPT-5.6の真価はベンチマークスコアだけではない。実務者が日々使うツールやワークフローの中で、どれだけ「手戻り」を減らし「完成度」を高められるかが鍵だ。

Programmatic Tool Callingでツール連携が変わる

GPT-5.6に導入された Programmatic Tool Calling(プログラマティックツール呼び出し)は、モデル自身が軽量なプログラムをメモリ内で作成・実行し、ツール連携や中間結果の処理を自律的に進める仕組みだ。開発者が全ステップをスクリプト化する必要はなく、大量の中間データから必要な情報だけを抽出して次のアクションを判断する。

この仕組みにより、ツールを多用するワークフローでのトークン消費と往復回数が大幅に削減される。Responses APIで利用可能で、Zero Data Retention(ZDR)にも対応している。

max・ultra設定で複雑タスクを加速

GPT-5.6は効率重視のデフォルト動作に加えて、難易度の高いタスクに対して計算リソースを集中的に投下する設定を備える。max設定はxhighより長時間の推論と検証を許容し、ultraは並列エージェントで処理を高速化する。APIの価格帯は Sol が入力100万トークンあたり5ドル、出力同30ドルと公表されている。

コーディング性能の飛躍~開発者にとってのGPT-5.6

コーディング性能の飛躍~開発者にとってのGPT-5.6
従来の開発フロー(Before)
開発者が全ステップを逐次指示 → モデルが都度応答 → 大量のトークン往復が発生 → デバッグのたびに再実行
GPT-5.6 Sol の開発フロー(After)
1回の指示で複数ファイルにまたがるコード生成・CLI操作・パッチ適用まで自律実行。出力トークンは競合の半分未満

GPT-5.6 Solは現時点で最強のコーディングモデルと位置づけられている。Artificial Analysis Coding Agent Indexでは、max推論設定でスコア80を達成し、Claude Fable 5を2.8ポイント上回った。出力トークン数は半分未満、所要時間も半分以下、推定コストは約3分の1減という結果だ。

実コードベースでの強さ~DeepSWEとTerminal-Bench

GPT-5.6の優位性は、実コードベースでの長期エンジニアリングタスクを評価するDeepSWE v1.1やTerminal-Bench 2.1でも確認されている。Terminal-Bench 2.1ではSolが88.8%、ultra設定では91.9%に達し、GPT-5.5(85.6%)やClaude Fable 5(83.1%)を明確に引き離した。

複雑なコマンドラインワークフローを自律的に処理できるようになったことで、開発者がスクリプトの細部を逐一指示する必要は減り、「何を実現したいか」の指示だけで作業が進む体験に近づいている。

知識労働とデザイン判断力の進化

知識労働とデザイン判断力の進化
GPT-5.5(Before)
参照ファイルの一部を反映できず、スライドマスターのコンポーネントが欠落
GPT-5.6 Sol(After)
マスタースライドのレイアウト・タイポグラフィ・配色規則を推論し、忠実に適用

GPT-5.6は知識労働の質でも段違いの進化を見せる。Slack、Notion、Microsoft 365、Google Driveといった日常ツールから雑多な文脈を取り込み、専門家レベルの成果物に変換する能力が強化された。

プレゼンテーション・文書作成の実力

特に顕著なのがプレゼンテーション作成能力だ。GPT-5.6はプロンプトとソース資料から完全に編集可能なスライドを一から生成できる。レイアウト、階層構造、デザインの一貫性を備えた視覚的ナラティブを構築し、テンプレートやリファレンスデッキがある場合は、スライドマスターに埋め込まれたデザインルールさえ推論して適用する。

OpenAIの比較事例では、GPT-5.5が参照ファイルのマスタースライドコンポーネントを欠落させたのに対し、GPT-5.6はレイアウト・タイポグラフィ・配色・コンテンツパターンを忠実に再現した。文書やスプレッドシートでも、複雑な参照フォーマットの遵守、数式や財務モデルの精度、ページレイアウトの洗練度が向上している。

コンピュータ操作とUIデザインの判断力

GPT-5.6のコンピュータ操作能力は、コード生成にとどまらず、レンダリング結果の視覚的検証と改善までカバーする。高水準の指示だけで機能的かつ洗練されたUIを作成し、仕上がりを目視確認してから納品するフローが可能になった。BrowseCompではスコア92.2%と競合を上回り、OSWorld 2.0では62.6%を達成しながら出力トークン数を85%削減している。

セキュリティと安全性~進化した防護策

セキュリティと安全性~進化した防護策
防御的活用(推奨・強化)
SOCアナリスト 脆弱性トリアージ・マルウェア分析・検出エンジニアリング
開発者 セキュアコードレビュー・パッチ検証・脅威モデリング
悪用リスク(制限対象)
攻撃者 自律的なエンドツーエンド攻撃は難易度が高い。OpenAIの保護策がブロック

GPT-5.6はサイバーセキュリティ領域で飛躍的な性能向上を示した。ExploitBenchではGPT-5.5の47.9%から73.5%へ、ExploitGymでは15.1%から24.9%(2時間制限、6時間では33.7%)へと大幅に改善している。

デュアルユースを前提とした安全性設計

サイバーセキュリティは本質的にデュアルユース(両義的利用)の領域だ。脆弱性をつく能力が高まれば、同時にそれを見つけて修正する防御能力も高まる。OpenAIは「過剰なブロックは防御側の活動を阻害し、攻撃者は他のモデルやオープンソースツールを使い続ける」との立場をとっている。

そのためGPT-5.6の安全策は、一律ブロックではなく、リクエストの文脈と想定される結果を評価する多層構造を採用した。モデル内部に訓練された保護機能に加え、リアルタイムチェック、継続的モニタリング、アカウントレベルの制御が重層的に機能する。最も機微な能力はOpenAI DaybreakのTrusted Access for Cyberプログラムを通じて、認証済みの利用者のみに提供される。

約70万GPU時間のレッドチーミング

一般提供に先立ち、OpenAIは過去最大規模の安全性評価を実施した。外部専門家によるレッドチーミングに加え、約70万A100e GPU時間を投じたブラックボックス型の自動レッドチーミングで弱点を体系的に探索した。GPT-5.6 Solのサイバーセーフガードは、GPT-5.5比で約10倍の有害活動をブロックしている。

提供形態と価格~ChatGPT・Codex・APIのロールアウト

提供形態と価格~ChatGPT・Codex・APIのロールアウト

GPT-5.6は7月9日から全世界で段階的に提供が開始され、24時間以内に全ユーザーへの展開が完了する予定だ。

ChatGPT / Codex
Plus/Pro/Business/Enterprise Sol選択可、max/ultra設定利用可
Free/Go Terraを利用可能
API
Sol $5 input / $30 output(100万トークンあたり)
Terra $2.50 input / $15 output
Luna $1 input / $6 output

ChatGPTでは、Plus・Pro・Business・EnterpriseユーザーがGPT-5.6 Solに中〜高エフォート設定でアクセスできる。ProとEnterpriseは最高品質のSol Proも選択可能だ。Codexでは、Plus以上でSol・Terra・Lunaを選択でき、ultraはProとEnterpriseが利用できる。

APIの価格体系は前世代と比べて明確な選択肢を提供する。TerraとLunaの登場により、予算やタスクの重要度に応じて同じGPT-5.6アーキテクチャの恩恵を受けながら、コストを最適化できるようになった。

AI研究の自己加速~内部導入で見えた効果

OpenAIの社内では、GPT-5.6のテスト期間中に研究者1人あたりの1日平均出力トークン数がGPT-5.5のピーク時の2倍以上に達した。過去6カ月間で社内の研究向けコーディング推論の計算リソース消費は100倍に、エージェント型トークン利用は約22倍に増加している。

OpenAIはこの再帰的自己改善能力を「RSI Index」という内部評価指標でスコア化しており、GPT-5.6 SolはGPT-5.5から16.2ポイントの改善を示した。研究デバッグ、カーネル最適化、機械学習実験の自動化など、AIがAIの開発を加速する好循環が始まっている。

この記事のポイント

  • GPT-5.6はSol・Terra・Lunaの3モデル構成で、フラッグシップから低コストまで用途に応じた選択が可能
  • コーディング・知識労働・サイバーセキュリティ・科学研究の全領域でGPT-5.5を大幅に上回る性能を達成
  • 消費トークン数とコストの大幅削減により、同一予算での成果最大化を実現
  • 並列エージェントのultra設定やProgrammatic Tool Callingで複雑タスクの自律処理が加速
  • 約70万GPU時間のレッドチーミングを含む多層的安全策で、防御的利用を阻害せずに悪用を抑制
GPT-5.6 Solプレビュー、3モデル構成で知性とコストを最適化

GPT-5.6 Solプレビュー、3モデル構成で知性とコストを最適化

GPT-5.6シリーズの全体像

GPT-5.6シリーズは「Sol(ソル)」「Terra(テラ)」「Luna(ルナ)」の3モデルで構成される。Solはフラッグシップ、Terraは日常業務向けのバランス型、Lunaは高速かつ低価格なエントリーモデルだ。Terraは前世代のGPT-5.5に匹敵する性能を持ちつつ、利用コストが半減している点が実務上の大きな進歩になる。

新たに導入された命名規則では、数字が世代を、固有名詞が永続的な能力帯を示す。Sol・Terra・Lunaは、それぞれ独立したペースで進化していくため、ユーザーは知性・速度・コストのバランスをより明確に選べるようになる見込みだ。

Sol(フラッグシップ) 最高性能・最大推論時間・ultraモード対応
Terra(バランス型) GPT-5.5相当性能でコスト半減・日常の開発業務に最適
Luna(高速低価格) 最低コストで十分な能力・大量処理やプロトタイピング向け
フラッグシップ バランス型 高速低価格

3モデルとも安全対策のスタックがモデルごとに最適化されており、能力に応じたガードレールが設計されている。特にSolはサイバーセキュリティや生物学領域で顕著な性能向上を示しており、従来モデルより少ない出力トークン数で同等以上の成果を出せる点が特徴だ。

限定プレビューと政府関与の背景

今回の公開は、一般提供に先立つ限定プレビューという形をとっている。米国政府との継続的な協議の中で、信頼できるパートナー群に絞って先行提供し、テストと調整を進める方針が取られた。OpenAIの記事では、このような政府関与プロセスが長期的な標準になるべきではないと明言されており、最終的にはより広範な利用者への迅速な提供を目指すとしている。

プレビュー期間中は、実運用上のフィードバックをもとに安全対策のブロックや遅延を減らし、正規の防御的利用(コードレビュー、脆弱性調査、パッチ開発など)を妨げずに悪用を抑えるバランスが検証される。

性能評価と新たな推論モード

GPT-5.6 Solは、コーディング・生物学・サイバーセキュリティの各領域で新たな最高水準を記録している。以下に主なベンチマーク結果を示す。

Terminal-Bench 2.1 コマンドラインの計画・反復・ツール連携を評価。GPT-5.6 Solが新記録
GeneBench v1 長期的なゲノミクス解析でGPT-5.5超え・トークン消費も削減
ExploitBench / ExploitGym SolはMythos Previewと同等の性能を約1/3の出力トークンで達成

これらのスコアはいずれも、モデルが自律的にタスクを遂行するエージェント能力の高まりを示す。特にExploitBenchでは、脆弱性の発見からエクスプロイト構築までを含む長期的なセキュリティタスクで、効率と性能の両面で飛躍が見られる。

max推論努力とultraモード

GPT-5.6には、新たに「max」推論努力と「ultra」モードが導入された。maxはモデルが最も深く思考するための指示であり、ultraは単一エージェントの限界を超える仕組みだ。

max推論努力 モデルに最大の計算リソースを与え、深い思考を促す指示
ultraモード 複数のサブエージェントを起動し、複雑な作業を並列加速
ultraモードでは、例えばコード生成・テスト・修正が同時進行し、全体の完了時間が大幅に短縮される

ultraモードは、従来の逐次処理では時間がかかっていた複合タスクを、内部的に分割して並行実行する。これにより、開発者は複雑なワークフローでも応答待ちのストレスを感じにくくなる。ただし、このモードはSolのみがサポートしており、より多くのAPIコストを消費する点には注意が必要だ。

多層防御と安全対策の全容

GPT-5.6シリーズでは、モデル自体への拒否訓練、生成中のリアルタイム分類器、アカウントレベルの監視、差別化アクセス制御といった多層防御が導入されている。単一の対策に頼らず、各層が独立して機能することで、悪意ある利用者がいずれかを回避しても全体の防御力が維持される設計だ。

第1層 モデルレベルでの禁止リクエスト拒否(脱獄試行含む)
第2層 リアルタイム不正利用分類器(サイバー・生物学)
第3層 大規模推論モデルによる会話コンテキストの再審査
第4層 アカウントレベルでの横断的パターン検出と対応
第5層 差別化アクセスと継続的テスト・監視

リアルタイム分類器が違反の可能性を検知すると、生成が一時停止され、より大きな推論モデルが会話全体を評価する。不正と判断された出力はユーザーに届く前に遮断される仕組みだ。防御的セキュリティ作業と攻撃的文脈は表面的に似通うため、アカウント単位の長期的な行動パターン分析が両者を区別する鍵になる。

自動レッドチーミングと人的テストの融合

OpenAIは今回、70万A100相当GPU時間を自動レッドチーミングに投入した。この取り組みは、特定のプロンプトだけでなく、多様な文脈で通用する「ユニバーサル・ジェイルブレイク」の発見に焦点を当てている。攻撃パターンを機械的に網羅することで、人間のテスターだけでは発見しきれない弱点を早期に炙り出す狙いだ。

同時に、第三者の専門家による人的レッドチーミングも継続されており、創造的な悪用手法に対する防御テストが行われている。両者を組み合わせることで、固定化された既知の攻撃リストに依存しない、適応的な安全対策が実装されている。

価格・キャッシュ戦略とCerebras高速提供

GPT-5.6のAPI価格は100万トークンあたり、Solが入力5ドル/出力30ドル、Terraが入力2.5ドル/出力15ドル、Lunaが入力1ドル/出力6ドルに設定された。Terraのコストパフォーマンスは特に注目で、GPT-5.5と同等の性能を半額で利用できる。

また、プロンプトキャッシングの仕組みが予測しやすくなり、明示的なキャッシュブレークポイントの指定や最低30分のキャッシュ保持が保証される。キャッシュ書き込みは非キャッシュ時入力料金の1.25倍、読み取りは90%割引が適用される。長い会話や繰り返しの多いワークフローでは、この改善により実質コストが大幅に下がるだろう。

Sol $5 / $30 (入出力1Mトークン)
Terra $2.50 / $15 (GPT-5.5比で半額)
Luna $1 / $6 (最低価格帯)
キャッシュ利用時はさらにコスト削減可能。読み取りは90%ディスカウント

7月にはSolがCerebras上で最大750トークン/秒の速度で提供開始予定だ。これはフロンティアモデルとしては異例のスピードで、リアルタイム性が求められるユースケースに直接響く進化になる。当初は一部顧客に限定されるが、容量拡大に伴いアクセスは広がる見通しだ。

プレビューが示すAI開発の方向性

今回の限定プレビューからは、OpenAIがモデルの性能向上と安全対策をトレードオフにせず、同時に引き上げようとしている姿勢が読み取れる。特にサイバーセキュリティ領域では、防御側の能力を大幅に強化しつつ、攻撃的な悪用を多層的に抑制するアプローチが明確だ。

政府との協力プロセスについては、短期的な措置と位置づけられている。長期的な標準化は意図されておらず、むしろサイバー大統領令の枠組み整備と並行して、より開かれた提供への道筋を探る段階だ。このバランスが、今後のフロンティアモデル公開の前例として注目される。

開発者視点では、Terraの登場で高度な推論能力が手頃なコストで手に入るようになり、Lunaはプロトタイピングや大量処理の敷居を下げる。Solのultraモードは複雑なコードベースのリファクタリングや大規模テスト自動化など、これまで時間的制約で諦めていたワークフローを現実的にする可能性を秘めている。

💻 コーディング ultraモードで並列処理、ターミナル操作も高精度
🔬 生物学 ゲノミクス解析の長期的タスクで効率向上
🛡️ サイバー防御 脆弱性発見・パッチ開発を強力に支援

一方で、プレビュー期間中は安全フィルターによるブロックや遅延が発生しやすい。防御的利用と攻撃的利用が重なる領域では、正規の作業が一時的に制限されるケースも想定されている。このフィードバックが、一般提供時のスムーズな体験につながると考えられる。

この記事のポイント

  • GPT-5.6はSol・Terra・Lunaの3モデル体制で、性能とコストの選択肢が明確化された
  • TerraはGPT-5.5並みの能力を半額で提供し、実務導入のハードルを下げる
  • Solのultraモードはサブエージェントによる並列処理で複雑タスクを加速する
  • 多層防御と70万GPU時間の自動レッドチーミングで、フロンティアモデルとして最高水準の安全性を確保
  • 防御的セキュリティ用途への恩恵を最大化しつつ、悪用を抑制する設計が徹底されている
  • 政府との協力は短期的措置であり、数週間以内の一般提供を目指すロードマップが示された