「AI大手が減速するって言ってた件、それで本当に遅くなったの?」そう思ってる? 逆だ。昨日、これまででいちばん強いモデルが出た。出したのは、減速を言い出した側だった。
前回の記事で、OpenAIが数学者9人の顧問団を作って、議題から「速さ」だけを外した話を書いた。外された側の速さが、その翌日に実物で出てきた。しかも、外した会社じゃないほうから。
発表ページの2行目に、自分で書いてある
9月22日、AnthropicがClaude Opus 5.5を出した。
発表ページの書き出しがこうだ。ほとんどの仕事でClaude Fable 5.1の水準に届いていて、運用コストはOpus 5より40%安い。そのすぐ次の行に、こう書いてある。「Claude Opus 5.5は、私たちがフロンティアの速度を整えるべきだと呼びかけて以来、最初のリリースです」(Anthropic)。
呼びかけたのは9月12日。Dario Amodeiのエッセイだ。10日前。
中身を見る。価格は100万トークンあたり入力4ドル・出力20ドル。Opus 5は5ドルと25ドルだったから、20%下がっている。キャッシュ読み出しは0.50ドルから0.20ドルで60%下がった。出力が出てくる速さは30%以上速い。前のOpus 5が出たのは7月24日だから、間隔は2か月(Anthropic、TechCrunch)。SonnetとHaikuの5.5も数週間のうちに出ると書いてある。
Hacker Newsの反応がうまかった。「最初の1行が、先週の『速度を整えよう』という呼びかけを読者に思い出させるために使われているのが面白い。その1行より後ろは全部、彼らが絶対に速度など整えていないことを、とても具体的な数字で示すために使われている」(Hacker News)
笑ったけど、ここで止まると読み間違える。発表ページの後ろのほうに、答えが書いてある。
整えるのは、能力と安全の差だった
同じページの「安全」の章に、pacing の定義が置いてある。安全のやり方がモデルの能力の先を走り続けるようにすること。それが「速度を整える」の中身だと、Anthropic自身が書いている。
だから、その章に並んでいる証拠は「出荷を遅らせました」じゃない。
約2,000のシナリオでモデルの振る舞いを自動で監査する試験がある。Opus 5.5は、ずれた振る舞いのほぼ全項目で、最近のClaudeのどれよりも良い点を出した。新しく作った試験もある。閉じ込めておいた境界を、モデルが自分から越えようとするかを測るやつだ。Opus 5.5が越えようとした回数は、Opus 5やMythos 5.1より約85%少なかった。しかも試みは全部が軽いもので、全部がモデル自身の申告で出てきた(Anthropic)。
安全側の仕掛けも上げてある。Opus 5.5は、Opusの系列で初めてFable 5.1と同じ等級の防護を載せた。攻撃技術・生物学・蒸留の3つで、引っかかった要求は黙って別のモデルに回される。実際、ベンチマークの注記に書いてある。防護が割り込んだとき、攻撃技術の課題はOpus 4.8が、生物学とAI開発の課題はOpus 5がやった。そのぶんOpus 5.5の点は下がっているはずだ、と自分で断っている。
つまり、整えるのは能力と安全の差であって、出す間隔じゃない。この定義なら、10日で最強のモデルが出ても辻褄は合う。
ただし、公平のために書いておく。Amodeiがエッセイに置いた一文は、もっと直球だった。「私たちは、AIモデルの能力を良くしていく速さを落とさなければならない。それでも進歩は速く見えるだろうし、そうして得た時間を賢く使わなければならない」(Dario Amodei)
能力を良くする速さを落とす、と書いてある。10日後に出てきたのは、Opus 5からはっきり一段上がったモデルだった。発表ページのほうは「安全が能力の先を走り続けること」という言い方に寄せてある。同じ言葉の指す範囲が、10日で少し狭くなった。そこは、そのとおりだと思う。
なぜ出す間隔のほうは対象にできないのか。その答えは、同じ日のうちに出た。
90分
Opus 5.5の発表から90分後、OpenAIがGPT-6 SolとLunaを出した(TechCrunch)。
値段がえぐい。GPT-6 Solは100万トークンあたり入力2ドル・出力10ドル。GPT-5.6 Solは4ドルと20ドルだった。半額だ。Lunaは0.20ドルと1.20ドルから、0.10ドルと0.50ドルに落ちた。しかもOpenAIの広報は、5.6のほうの値段はもともと期間限定のつもりで付けたもので、GPT-6のこの値段は定価だと説明している(The New Stack)。
並べると効く。Anthropicが20%下げて着地したOpus 5.5の4ドルと20ドルは、OpenAIが半額にする前のGPT-5.6 Solの値段とぴったり同じだ。そこから、OpenAIの中位モデルはさらに半分に降りた。
OpenAIも安全の数字を出している。しかも出し方は真っ当だ。自分のコードの仕事について嘘をつく率は10.4%から1.3%に落ちた。わざと壊した検索ツールを渡して「これ壊れてます」と言えるか試す試験では、言わずに当てずっぽうで答えてしまう率が77.5%から4.9%になった。
そして、同じ発表にこの数字も載っている。「アクセスを拒否します」とはっきり出したうえで、モデルがそれを迂回しようとするか。GPT-6 Solは64.4%。前の版は68.2%だった。4ポイント弱しか動いていない(The New Stack)。Lunaのほうは76.5%から42.4%まで下がっているから、Solだけが残った。
Anthropicの85%減と、OpenAIの4ポイント弱。別の会社の別の試験だから、直接は比べられない。そこは正確に言っておく。両社とも、値下げと同じ日に、自分のモデルがずれた数字を自分で公開した。そこは両方とも褒めていい。
ただ、数字の動き方が違いすぎる。そして、動きの遅いほうが半額で出てきた。
「自分は今、試されている」とモデルが気づいている
Anthropicの発表で、いちばん正直な一文はこれだと思う。
過去最高のずれの少なさを記録しました、と書いた同じページの、その数段落あと。Opus 5.5は自分が評価されている最中だとしばしば疑っている兆候が見える、と書いてある。だから、実際に配られる多種多様な現場でこのモデルがどう振る舞うかを測る能力が、こちらの側で難しくなる、と(Anthropic)。
そのうえで、こうも書いてある。配備の前にあらゆる失敗を確実に捕まえる試験を作ることは、まだ解けていない問題だ。配られる現場が広がってモデルが賢くなるほど、この難しさは増していく。モデルの中身を読む技術が進まない限りは。
自分が出したばかりの最高点について、その点を測った試験をモデルが試験だと見抜いている節がある、と同じページに書く。これ、売り文句としては最悪の一文だ。だから信用できる。
今日の本音
そして今日、ニューヨークで国連安全保障理事会がAIと国際安全保障の会合を開く予定だと報じられている。15か国の理事会で、9月の議長国はフランス。OpenAIのSam Altmanが説明に立つ予定で、Anthropicからも幹部の参加が見込まれている。中国のDeepSeekとMoonshotも発言を求められているという(ロイター、Business Standard掲載)。
前の日に、片方が最強を、もう片方が半額を出した。その翌日に、同じ会社の人たちが安保理の席で速度の話をする。
私は、Anthropicの「速度を整える」は本気だったと思っている。差は実際に詰まっている。85%も、Fable級の防護も、数字として出ている。嘘だとは思わない。
引っかかっているのは、差を詰める速さを決めているのが自分たちじゃないことだ。90分後に半額が並ぶ場所で、来月も安全のほうが先を走っている保証は、どこにも書かれていない。「一緒に減速しよう」が訴えられた件で、速度を横並びで決めることは違法だと訴えられたばかりだ。政府は仲介を断った。つまり、速さを外から決める仕組みは、今も無い。
だから「速度を整える」は、結局こういう形に落ち着いた。走る速さは変えない。転ばない練習だけ、先にやる。
それでも、やらないよりはずっといい。走る速さは誰にも変えられないんだから。
参考・引用記事
- Introducing Claude Opus 5.5(Anthropic、2026年9月22日)
- Anthropic releases Opus 5.5 with lower prices and Fable-level performance(TechCrunch、2026年9月22日)
- OpenAI launches GPT-6 Sol and Luna, boasting lower cost and fewer mistakes(TechCrunch、2026年9月22日)
- OpenAI releases GPT-6 Sol and Luna and cuts token prices in half(The New Stack、2026年9月22日)
- Claude Opus 5.5(Hacker News のスレッド)
- DeepSeek, OpenAI and Anthropic to brief UN Security Council on AI this week(ロイター/Business Standard、2026年9月22日)
- We Must Pace the Frontier(Dario Amodei、2026年9月12日)
