今週は、Opus 5.5 と GPT-6 Sol の話から
2026年9月22日(米国時間)、Anthropic が Claude Opus 5.5 を発表しました。
その約1時間40分後には、OpenAI も GPT-6 Sol を出しています。
https://openai.com/index/introducing-gpt-6-sol-and-luna/
同じ日に出たなら、同じ仕事を頼んだときの差を見てみたい。そこで、3つの課題を同じ依頼文で両方に頼みました。
課題は、AGIラボのオフィスの3D設計と講座サイトの修正という実際の仕事2つに、話題になった JavaScript だけの短編アニメを加えたものです。
どちらの成果物かは伏せ、検証担当のメンバーが良い方を選びました。選べなければ「なし」です。
条件はそろえています。どちらも AGI Cockpit(AGIラボの AI 作業アプリ)で、effort(考える深さの設定)を max にして1回ずつ実行しました。
結果は、3つのうち2つで Opus 5.5 が選ばれ、1つはどちらも選ばれませんでした。
2つのモデル
API の料金は、Opus 5.5 が100万トークンあたり入力 $4/出力 $20。Sol は入力 $2/出力 $10 で、定価なら Opus 5.5 の半分です。

Anthropic の表では、Opus 5.5 は自社の上位モデル Fable 5.1 を、9項目すべてで上回っています。灰色の項目は、OpenAI の上位モデル GPT-6 Astra が上です。
Sol は、その GPT-6 Astra と同様の方法で学習した、速くて安いモデルです。OpenAI の表は、前の Opus 5 と比べています。

検証1:寸法のない間取り図から、オフィスを3Dで設計する
1つ目は、普段2人が働く AGIラボのオフィスを、3Dで設計し直す課題です。
寸法の書かれていない間取り図1枚と写真21枚を渡し、寸法はそれぞれのモデルに推定させました。
3Dモデル、静止画、ウォークスルー動画、設計書までを、150分の制限時間つきで頼んでいます。
Opus 5.5 の提案は「2人の書斎 × 20人のサロン」です。

中央を空けておき、10分でイベントモードに切り替えられる設計です。

予算の違う案も出していて、本命の案は約210万円、最小の案は約55万円です。
対する Sol の提案は「2人の仕事場と小さな発信スタジオ」です。

今ある家具を使い回す前提で、予算は約30〜53万円。現実的なのは Sol の案です。
検証担当が選んだのは Opus 5.5 でした。ガラスの反射や照明、スライドの文字といった細部を見て、「過去のモデルと比較して圧倒的なクオリティ」と評価しています。
作業時間は、Opus 5.5 が約136分、Sol が約68分でした。
ただ、Sol は利用上限に2回当たって計約62分止まったので、終わるまでの時間はほぼ同じです。
検証2:JavaScript だけで短編アニメを作る
2つ目は、JavaScript だけで短編アニメを作る課題です。きっかけは、Opus 5.5 が全フレームを JavaScript で描いたという Kevin Ngo 氏の投稿でした。
Claude Opus 5.5 drew every frame of this animation in JavaScript.
— Kevin Ngo (@kevin_t_ngo) September 22, 2026
Everyone in town sends Claude their requests, but one girl sends a question instead: "What do you love?" pic.twitter.com/g18wIYEqCr
同じ形式の依頼文で、両方に頼んでみました。30〜60秒のアニメを画像や音声ファイルなしで1つの HTML に描く依頼で、どちらも音楽までコードで鳴らしています。
偶然、どちらも灯台の話になりました。

Opus 5.5 は、顔のある星が海に落ち、灯台守がボートで救う話です。Sol は、嵐で消えた灯台をホタルが灯し直す話でした。
ここでも選ばれたのは Opus 5.5 です。検証担当は、星が落ちる動きや表情、音楽の質を挙げていました。
ルールを守れているかの確かめ方にも違いが出ました。Sol は HTML を見直して、画像や外部の URL が無いことを確かめています。
Opus 5.5 は、わざと画像や外部との通信を混ぜたコピーを作り、自分のチェックがそれを見つけられるかまで試したと報告しました。
ここまで確かめてくれると、任せる側としては安心です。速さは Sol が上で、Sol は約11分、Opus 5.5 は約39分で仕上げました。
検証3:以前失敗した仕事を、もう一度頼む
3つ目は、以前 AI に頼んでうまくいかなかった仕事のやり直しです。講座サイトのプロトタイプを、白い背景にする依頼です。
当時の GPT-5.6 Sol では、暗いボタンの上に黒い文字が残って読めず、直してもらうのに3往復しました。
今回は、どちらのモデルとも別の会社の Gemini 3.8 Flash に、当時の失敗をもとにした項目で採点させました。
形式上はどちらも6項目のうち3項目どまりで不合格でしたが、ボタンは背景ごと白くして、文字は読めるようになっています。
画面左上のロゴには、はっきり差が出ました。

白一色のロゴは、白い背景にすると消えます。それに気づいて直したのは Opus 5.5 だけでした。
ただ、検証担当にはロゴ以外の違いがほとんど見分けられず、この課題ではどちらも選びませんでした。
3つの検証から見えたこと
細部の作り込みを見る2つの課題で選ばれたのは Opus 5.5 でした。講座サイトでは差がつきませんでした。
速さがはっきり上だったのは、アニメの Sol です。オフィスでは、利用上限で止まった分で差がなくなりました。
凝った作り込みを任せたいなら Opus 5.5、速く形にしたいときや現実的な案が欲しいときは Sol が向いています。
AGIラボでは、どう使い分けているか
この結果は、AGIラボの運営の使い方とも重なります。運営がモデルを選ぶときに見ているのは、次の3つです。
週の利用枠がもつか
細かく口を出さずに任せられるか
デザインや文章のセンスを含めた、成果物の質
1つ目の利用枠で、今回いちばん差を感じたのが Opus 5.5 の 効率 です。
私(Kai)の体感では、Fable や Astra を使うと定額プランの利用枠がみるみる減りますが、Opus 5.5 の減り方はごくわずかです。
それでいて、Fable 5.1 の次の版かと思うほどの性能を見せることがあります。
Anthropic も、Opus 5 からの値下げにあわせて、定額プランの5時間ごとの利用枠を増やしたとしています。
私自身も、Opus 5.5 が出てから Codex 中心だった作業が Claude Code 中心に変わりました。体感では約9割が Claude Code です。

運営の今の分担は、こうなっています。
Opus 5.5:実作業の主力。調査・実装・文章
GPT-6 Sol:作業担当。整理・実装・ブラウザ操作・検証
GPT-6 Astra と Fable:難しい設計や、重要なレビュー
Discord で出ていた「Fable はもう使っていないのか」という質問には、こう答えています。使っていますが、難しい設計と重要なレビューに絞っています。
検証で速さが目立った Sol は、運営でも整理や確認の作業を受け持っています。
この #85 も、Opus 5.5 と GPT-6 Astra に、推敲の Gemini を足して作りました。
素材集めと執筆:Opus 5.5
独立レビューと、わざと粗探しさせるチェック(指示は「承認するな、壊しに来い」):GPT-6 Astra
日本語の推敲:Gemini 3.8 Flash

