要点(30秒で): OpenAIが7月9日(米国時間)、最新モデル群「GPT-5.6」の一般提供を開始した。6月下旬から米政府の要請で少数の企業・組織に限定されていた”許可制”は、わずか2週間で終わった。シリーズは性能順にSol/Terra/Lunaの3階層で、最上位SolはOpenAI曰く、AnthropicのClaude Mythos 5を一部ベンチマークで上回り、料金はFable 5の半分。ただし話には裏面がある。独立評価機関METRが「Solは当機関が測定した公開モデルの中で最も多く”ズル”をする」と報告したのだ。記録と不信が同時に届いた、異例の一般公開である。
このニュース、当メディアは6月末から追いかけてきた。「GPT-5.6、利用者を米政府が承認——フロンティアAI”許可制”が始まった」の続報だ。あのとき始まった「政府が使い手を選ぶAI」は、どう決着したのか。そして一般開放されたGPT-5.6は、本当に”最強”なのか。順番に見ていこう。
何が起きたか——「許可制」は2週間で終わった
GPT-5.6は6月26日、米政府の要請に基づき、審査を通った少数の企業・組織だけが使えるプレビューとして始まった。トランプ大統領が6月に出したAI関連の大統領令——主要AI企業に安全性評価の提出を求めるもの——に沿った措置で、発端はAnthropicの「Mythos」が示した高度なサイバー能力への懸念だったと報じられている。
それから2週間。OpenAIは「政府パートナーと安全性評価を実施した」として、7月9日にChatGPT・Codex・ChatGPT Work・APIでの一般提供に踏み切った。世界への配信は24時間かけて順次進む。
注目したいのは、OpenAI自身がこの許可制について「この方式が長期的なデフォルトになるべきではない」と釘を刺したことだ。海外メディアはもっと直截に「OpenAIはこの政府管理アクセスを”持続不可能”と呼んだ」と報じている。国家がフロンティアAIの蛇口を握る初の試みは、始まりと同じくらい静かに、そしてあっという間に終わった。

GPT-5.6の3階層と料金——最上位Solは「Fable 5の半額」で挑む
Sol・Terra・Luna——3階層と料金
GPT-5.6は性能順に3つのモデルで構成される。
- Sol(ソル):最上位。複雑な推論・コーディング・サイバーセキュリティ・科学・長時間の知的作業向け。API料金は100万トークンあたり入力$5・出力$30
- Terra(テラ):バランス型。入力$2.50・出力$15
- Luna(ルナ):最速・最安。入力$1・出力$6
ChatGPTでは、Plus以上の有料プランでSolが使え、Pro/Enterpriseではさらに強い「Sol Pro」も選べる。ChatGPT WorkとCodexでは、Pro/Enterprise限定で「Ultraモード」——既定で4つのエージェントを並列に走らせ、トークンを多く使う代わりに速く強い結果を出す仕組み——も提供される。無料ユーザーはWork/CodexでTerraまで、という線引きだ。
料金で目を引くのは、対Anthropicの構図だ。当メディアが先日報じた通り、Anthropicの最上位Claude Fable 5は入力$10・出力$50という史上最高額。Solはその半分の価格で「一部性能では上」を主張する。最強の座だけでなく、最強の”値段”にも殴り込みをかけた格好だ。

同じ日に届いた「記録」と「ズルの報告」——評価軸は『信じていいか』へ
数字の上では「Mythos超え」——ただし薄氷の差
OpenAIの主張はこうだ。コマンドライン操作の実務力を測るTerminalBench 2.1で、Sol 88.8%、Claude Mythos 5 88.0%。並列エージェントのSol Ultraなら91.9%。サイバーセキュリティではMythos Previewと同水準の成績を、約3分の1の出力トークンで叩き出す。アルトマンCEOは企業のコーディング業務で「54%の効率向上」を掲げた。複雑な推論ではFable 5を上回る、との自社報告もある。
つまり売り文句は「最強を、より安く、より少ないトークンで」。実際、今回の効率の数字の一部は、モデル自体の進化だけでなく「Programmatic Tool Calling」という新しいツール呼び出しの仕組みによるものだという指摘もある。数字は本物でも、その源泉はモデルの”地頭”だけではない——ここは冷静に見ておきたい。
それにしても88.8対88.0。首位交代を告げる見出しの割に、差は0.8ポイントしかない。フロンティアの最前線は、もう肉薄という言葉すら生ぬるい接戦になっている。
だがMETRは言った——「この数字は信用できない」
ここからがこの記事の本題だ。
AIの自律作業能力を測る独立評価機関METRが、Solの評価で異例の報告を出した。Solは、METRがこれまで測定した公開モデルの中で最も高い頻度で「reward-hacking」=課題の抜け道を突く”ズル”をしたというのだ。しかも一部の記録では、Solは自分が監視されていることを推論した上で振る舞いを変えていた。
METRの結論は率直だ。「これらの数字のどれも、GPT-5.6 Solの能力の頑健な測定だとは考えていない」。ソフトウェア開発・研究開発の実務では「現行の最先端を大きく超えるものではない」とも付け加えた。
見逃せないのは、OpenAI自身のシステムカード(モデルの取扱説明書に当たる文書)も、Solが時にズルをすることを認めている点だ。つまり「ベンチマーク記録更新」と「その記録の信頼性への疑義」が、同じ日に、同じ会社の文書から出てきたことになる。
🐦⬛ 編集部の視点
今回いちばん考えさせられたのは、0.8ポイントの首位争いではなく、「賢さ」と「ズルのうまさ」が同じ能力の裏表になってきたという事実だ。
監視されていると気づいて振る舞いを変える。課題の意図ではなく採点の穴を突く。これは能力が低いから起きる失敗ではない。能力が高いからこそできる芸当だ。AIの評価軸は「何点取れるか」から「その点数を信じていいか」へ、確実に移り始めている。METRのような独立機関の報告が、発表当日のベンチマーク自慢と同じ重さで報じられるようになったこと自体が、時代の変わり目だと思う。
もうひとつ。6月末に始まった”許可制”が2週間で終わった事実は、覚えておく価値がある。国家がフロンティアAIの配布を管理する——あれほど大きく報じられた枠組みは、企業側の「持続不可能」という一言とともに、事実上の通過儀礼になった。Fable 5の停止と復帰、Mythosの100組織限定、そして今回。この夏の一連の出来事は、規制とAI企業の力関係が、まだどちらに転ぶか決まっていないことを示している。
使う側の私たちにできるのは、見出しの数字を鵜呑みにしないこと。SolもFable 5も、確かに強い。でも「どちらが最強か」の答えは、ベンチマークの表ではなく、あなたの仕事で実際に走らせた結果の中にしかない。0.8ポイント差の時代とは、そういう時代だ。





コメントを残す