Claude Opus 5.5 は切り替えるべきか——Opus 5 より 2 割安く、Fable 5.1 を上回るスコアをどう読むか

Claude Opus 5.5 は Opus 5 より単価が 2 割、キャッシュ読み出しが 6 割安くなりました。切り替えてよいモデルですが、費用が下がる理由の一つは既定の effort が medium に下がったことにあります。ベンチマークの読み方と、API 移行で止まる 4 つの書き方もまとめました。

Anthropic が 2026 年 9 月 22 日に Claude Opus 5.5 を公開しました。性能が上がり、同時に価格が下がるという、これまであまりなかった形の更新です。Claude Code では、モデルを自分で指定していなければ、既定のモデルがもう Opus 5.5 に変わっています。

気になるのは、今使っているモデルから切り替えるべきかどうかと、切り替えると何がどれだけ変わるかだと思います。3 週間前に出た Fable 5.1 との関係も分かりにくくなりました。発表ではベンチマークの全項目で Opus 5.5 が Fable 5.1 を上回っているのに、価格は Fable 5.1 の 4 割です。上位のモデルが要らなくなったのか、という疑問が出てきます。

この記事では、Anthropic の発表ページと開発者向けドキュメントを直接読み、書かれている数字だけで答えを出します。

切り替えてよいモデルです。Opus 5 と比べて入力と出力の単価は 20% 安く、キャッシュの読み出しは 60% 安くなりました。Anthropic の試算では、既定の設定のままなら典型的な使い方で 40% 安くなります。出力の速さも 30% 以上上がっています。ただし、何も指定しなかったときの考える深さ(effort)が high から medium に一段下がっており、この 40% は既定の深さのままで測った値です。ベンチマークでは 9 項目すべてで Fable 5.1 を上回りますが、Anthropic 自身が、この水準ではスコアの差は以前ほど実際の違いを表さないと書いています。API で使っている場合は、Opus 5 で通っていた書き方のうち 4 つがエラーになるので、切り替える前にコードを確認してください。

この記事の要約

この記事の調べ方

価格・性能・顧客の実測値は Anthropic の発表ページを、移行時の変更点・既定値・提供範囲は Claude の開発者向けドキュメントと Claude Code のドキュメントを、2026 年 9 月 23 日に開いて確認しました。ベンチマークの表は、列の並び(Opus 5.5 / Fable 5.1 / Opus 5 / GPT-6 Astra / GPT-5.6 Sol)を読み直したうえで転記しています。報道やほかの解説記事は根拠に使っていません。

切り替えるかどうか。答えは「切り替えてよい、ただし考える深さを決め直す」

Opus 5 を使っているなら、切り替えない理由はほとんどありません。同じ仕事を安く、速く、同等以上の出来で返すモデルとして出てきたからです。Anthropic も開発者向けドキュメントで「どのモデルを使うか迷ったら、まず Opus 5.5 から始める」と書いており、Fable 5.1 は「難しい推論や長時間の自律作業、または Opus 5.5 で深さを上げても評価が足りないときに使う」という位置づけになりました。

ひとつだけ、切り替える前に決めておくことがあります。の既定値です。Opus 5 は、何も指定しなければ high で動いていました。Opus 5.5 は medium で動きます。つまり、コードや設定を変えずにモデル名だけを差し替えると、考える深さが一段下がった状態で動き始めます。

既定が下がったからといって、品質が落ちるとは限りません。発表ページに載っている顧客の声では、Factory が「medium を既定にしてよいと思えた最初のモデル」と評価しており、effort を最も低くしても Opus 5 を high で動かした結果を上回った例も並んでいます。ただ、今まで high で出ていた品質を前提に仕組みを組んでいるなら、切り替えた直後に自分の業務で結果を見比べる手順を 1 回は挟んでください。

  • Claude Code で使っている。バージョン 2.1.280 以降で、モデルを自分で指定していなければ、すでに Opus 5.5 になっています。気になる作業があれば、切り替わる前との出来を見比べてください。
  • API で Opus 5 を使っている。モデル名を claude-opus-5-5 に変え、後半で説明する 4 つの書き方を直し、effort を明示してください。
  • Fable 5.1 を使っている。Opus 5.5 で同じ作業を試し、足りるなら費用は 4 割になります。足りなければ Fable 5.1 に残ります。
  • Sonnet 5 を使っている。入出力の単価は Sonnet 5 のほうがまだ半分なので、急いで上げる理由はありません。数週間後に Sonnet 5.5 が出る予定です。

価格は Opus 5 より 2 割安く、Fable 5.1 の 4 割

まず単価を並べます。すべて 100 万あたりの米ドル建てです。値はすべて Claude の開発者向けドキュメントの価格表から取っています。

項目Opus 5.5Opus 5Fable 5.1
入力$4$5$10
出力$20$25$50
の読み出し$0.20$0.50$0.25
キャッシュの書き込み(5 分保持)$5$6.25$12.50
既定の effortmediumhighhigh

入力と出力は Opus 5 からちょうど 2 割下がりました。大きいのはキャッシュの読み出しで、$0.50 から $0.20 へ 6 割下がっています。Anthropic は発表で、エージェントやコーディングの仕事では費用の大半がキャッシュの読み出しだと書いています。Claude Code のように同じ指示文とファイルを何十回も読み直す使い方では、ここの値下げが一番効きます。

Fable 5.1 と比べると、入力と出力は 4 割の価格です。キャッシュの読み出しに至っては、Fable 5.1 の $0.25 より Opus 5.5 の $0.20 のほうが安くなりました。上位モデルのほうがキャッシュが安いという 3 週間前の状態が、もう逆転しています。Fable 5.1 の料金の仕組みはFable 5.1 の解説記事に書いています。

Opus 5.5・Opus 5・Fable 5.1 の入力・出力・キャッシュ読み出しの単価と、Terminal-Bench 4.0 のスコアを並べた図
Opus 5.5 は 3 つのモデルの中で最も安く、公表スコアは最も高くなっています。ただしスコアの差は、Anthropic 自身が割り引いて読むよう書いています。

速さについても書いておきます。発表では、Opus 5.5 の出力は Opus 5 より 30% 以上速いとされています。さらに速くしたい場合は Fast mode があり、最大 2.5 倍の速さで、単価は入力 $8・出力 $40 です。通常の 2 倍の料金を払って速さを買う形になります。Fast mode は Claude Code と Claude の API で使え、Amazon Bedrock、Claude Platform on AWS、Google Cloud、Microsoft Foundry 経由では使えません。API ではまだ試験提供の扱いです。

費用が下がる理由は 2 つ。単価と、使うトークンの量

Anthropic の「既定の設定なら典型的な使い方で Opus 5 より 40% 安い」という数字は、単価の値下げ 2 割よりも大きくなっています。発表ページは、1 トークンあたりが安くなったことに加えて、1 つの仕事を終えるまでに使うトークンの量が減ったことを挙げています。顧客の実測にも、トークンや手順の数が減ったという報告が多く並んでいます。

顧客発表ページに書かれている実測
BoxOpus 5 の 3 分の 1 のトークンで済み、回答は正確さを落とさずに 40% 短くなった
OptiverOpus 5 と同じ品質を、やりとりの回数・時間・出力トークンのおよそ半分で出し、その仕事の費用が 40〜50% 下がった
Rogo金融の評価で、Opus 5 を high で動かした結果を、出力トークンを約 60% 減らして上回った
KiroOpus 5 より多く解き、呼び出しの回数は約 40% 少なく、トークンは半分だった
Deloitteeffort を最も低くしても、コードレビューで既知の不具合の 72% を見つけた。Opus 5 は high で 56%。
Walleye Capitaleffort を最も低くしても、評価用の課題をほぼ解いた

トークンが減った理由については、開発者向けドキュメントに見落としやすい一文があります。同じ effort で比べると、Opus 5.5 は 1 回のやりとりあたり Opus 5 より多く考える傾向があり、xhigh や max ではその差が特に大きい、というものです。

つまり、同じ effort で比べれば 1 回ごとの考える量はむしろ増えています。それでも全体のトークンが減るのは、少ない手順で仕事を終えるようになったことと、既定の effort が medium に下がったことが重なっているからだと考えられます。Anthropic の 40% も、既定の設定のままで測った値です。

実務に引き直すと、こうなります。モデル名を差し替えるだけなら、ほぼ確実に安くなります。一方で、品質を保つために effort を high や xhigh に上げ直すと、1 回あたりに考える量は Opus 5 のときより増えるので、下がり幅は 40% より小さくなる可能性があります。顧客の Viktor のように、同じ effort でも手順が減って費用がほぼ半分になったという報告もあるので、結果は仕事の中身次第です。どこまで下げても品質が保てるかは、自分の業務で試さないと分かりません。Anthropic も移行ガイドで「effort の段階ごとに試し直すこと」を最初の推奨にしています。

ベンチマークは全項目で Fable 5.1 を上回る。ただし Anthropic 自身が割り引いている

発表ページには 9 項目のベンチマークが載っています。列の並び(Opus 5.5 / Fable 5.1 / Opus 5 / GPT-6 Astra / GPT-5.6 Sol)を確認したうえで、まず Claude の 3 モデルを転記します。GDPval-AA は点数、それ以外は正答率(%)です。Terminal-Bench はコマンド操作を伴うコーディング、GDPval-AA は知的労働、AutomationBench は業務の自動化、OSWorld はパソコン操作、Chartography は図表の読み取りを測るもので、Humanity's Last Exam と Chartography はツールを使える条件での値です。

ベンチマークOpus 5.5Fable 5.1Opus 5
Terminal-Bench 4.066.455.852.3
FrontierCode v1.154.450.348.0
CursorBench 4.057.851.846.6
GDPval-AA v2.1(点)184617351708
AutomationBench40.031.426.9
Humanity's Last Exam67.765.663.6
Terminal-Bench-Science 0.158.752.629.0
OSWorld 2.081.880.774.0
Chartography89.088.483.4

同じ発表ページには、OpenAI のモデルの値も並んでいます。値が載っている項目だけを抜き出すと、次のとおりです。

ベンチマークOpus 5.5GPT-6 AstraGPT-5.6 Sol
Terminal-Bench 4.066.457.937.3
FrontierCode v1.154.453.347.5
CursorBench 4.057.8—41.7
GDPval-AA v2.1(点)184615421588
AutomationBench40.041.428.8
Humanity's Last Exam67.757.2—
Terminal-Bench-Science 0.158.764.622.4

「—」は発表ページに値が無い欄です。Claude の 3 モデルの中では 9 項目すべてで Opus 5.5 が最も高い一方、OpenAI のモデルまで含めると、AutomationBench と Terminal-Bench-Science の 2 項目は GPT-6 Astra が上です。どの項目でも一番、というわけではありません。

この表には、Anthropic 自身が読み方の注意を添えています。同じ発表ページの一文です。

この水準の能力になると、ベンチマークでの差は、実際の違いを見る手がかりとして以前ほど当てにならなくなってきた。自分たちで使う限り、Opus 5.5 と Claude Fable 5.1 の差は、これらのスコアが示すよりも小さい。

Anthropic「Claude Opus 5.5」発表ページより(原文は英語、筆者訳。2026 年 9 月 23 日参照)

作った会社が、自社の新モデルの勝ち幅を自分で割り引いています。たとえば Terminal-Bench 4.0 では Opus 5.5 と Fable 5.1 の差が 10 ポイント以上ありますが、Anthropic が実際に使った感触では、両者の差はスコアが示すほど大きくない、ということです。はてなベースでは OSS ツールを比較する記事でも、公表値を鵜呑みにせず自分の条件で確かめる立場を取ってきました。それを作り手自身が書いている形です。

表の注記にも、読み方に関わることが書かれています。Opus 5.5 のスコアは、特に断りが無ければ最も深い max で測った値です。Terminal-Bench 4.0 だけは、Opus 5.5 が xhigh、GPT-6 Astra が OpenAI の公表した high の値です。どちらにしても、既定の medium のまま使ったときの値ではありません。標準誤差も 2 項目で示されており、Terminal-Bench 4.0 は Opus 5.5 が ±2.6 ポイント、Terminal-Bench-Science は ±3.5〜5 ポイントです。この 2 項目では、数ポイントの差は誤差の範囲に入ります。

もう 1 点、逆向きの注記もあります。安全対策を有効にしたまま測ったため、対策が働いた課題は別のモデルが代わりに解いており、そのぶん Opus 5.5 のスコアは下がっている可能性が高い、というものです。AutomationBench は測定した Zapier が代わりのモデルを使わず、安全対策が働いた課題を失敗として数えています。実際に使うときより低い点になっている、と発表ページは書いています。

では Fable 5.1 はもう要らないのか

Anthropic の開発者向けドキュメントは、Fable 5.1 を「難しい推論と長時間の自律作業向け」、Opus 5.5 を「長時間のコーディングと知的作業向け」と分けています。そのうえで、迷ったら Opus 5.5 から始め、深さを上げても足りないときに Fable 5.1 を使うよう勧めています。入力と出力の単価が 2.5 倍なので、Fable 5.1 は「Opus 5.5 で試して足りなかった作業」に絞って使うのが筋です。

Claude Code は、何もしなくても Opus 5.5 に切り替わっている

Claude Code のドキュメントでは、Pro、Max、Team、Enterprise の各プランと API のどれでも、既定のモデルが Opus 5.5 になっています。/model opus と打ったときに選ばれるのも Opus 5.5 です。例外は Microsoft Foundry 経由で使っている場合で、既定のモデルも opus の指す先も別のモデルのままです。

Claude Code の effort の既定値も、モデルによって違います。effort に対応したモデルの多くは high が既定ですが、Opus 5.5 は medium です。ここで一つ注意があります。ユーザー設定ファイルの一番上の階層に effort の既定値(effortLevel)を書いていても、その設定は Opus 5.5 には効きません。Opus 5 や Fable 5.1 以前のモデルにだけ効き続けます。「前に high に設定したはず」と思っていても、Opus 5.5 は medium で動いている可能性があります。モデルごとの設定やプロジェクト単位の設定で指定した値は、Opus 5.5 にも効きます。

また、Opus 5.5 では考える処理(thinking)を切ることができません。Claude Code のセッション内の切り替えや、考えるトークンを 0 にする環境変数を設定しても、効果はありません。軽くしたいときは effort を下げます。Opus 5.5 を使うには Claude Code のバージョン 2.1.280 以降が必要です。

はてなベースでも Claude Code を日々の開発と記事制作に使っていますが、この記事の下調べをした時点で、使っていたセッションの既定はすでに Opus 5.5 に変わっていました。Claude Code の基本的な使い方はClaude Code の使い方ガイドに、利用上限については利用上限の解説記事にまとめています。

API で使っている場合、Opus 5 で通っていた書き方のうち 4 つがエラーになる

ここからは、自社のシステムや業務の仕組みに Claude の API を組み込んでいる方向けの内容です。Claude のアプリや Claude Code だけを使っている方は、次の節まで飛ばして構いません。

開発者向けドキュメントは、Opus 5 で動いていたコードに影響する変更を 4 つ挙げています。該当する書き方が残ったままモデル名だけを差し替えると、その呼び出しがエラー(HTTP 400)で止まります。3 つ目と 4 つ目は、アカウントの作成日や使っている提供先によって対象が変わります。

変わることOpus 5.5 でどうなるか直し方
考える処理を切る指定、考える量を手で決める指定エラーになる。考える処理は常に有効。指定を外し、effort で深さを決める
特定のツールを必ず使わせる指定(tool_choice の any と tool)エラーになる。トークン数を数える窓口でも同じ。auto に戻し、厳密なツール使用か構造化出力を使う。ツールを使う場面はプロンプトに書く。
会話の途中で指示文やツール定義や過去の発言を書き換える2026 年 8 月 31 日以降に作ったアカウントでは、書き換え後に過去の考えた内容を送り直すとエラーになる会話は付け足すだけにし、指示の変更は会話途中のシステムメッセージで行う
旧版のパソコン操作ツール(computer_20251124)Claude の API と Google Cloud ではエラーになる。Amazon Bedrock では引き続き動く。新しいツール一式(computer_toolset_20260801)に移す

3 つ目は分かりにくいので補足します。Opus 5.5 が考えた内容(thinking ブロック)は、そのときの会話の中身と結びついて記録されます。あとから前の指示文やツール定義を書き換えて同じ内容を送り直すと、API がそれを検出して止めます。2026 年 8 月 31 日以降に作った API アカウントでは、この確認が最初から有効です。Fable 5.1 と同じ扱いで、Anthropic はこれを「蒸留(出力を集めて別のモデルに学ばせること)を防ぐ仕組み」と説明しています。

エラーにはならないものの、見た目が変わる点も 1 つあります。ツールを呼ぶ合間にモデルが書く短い途中経過が、通常の本文ではなく、考えた内容の枠で返ってくるようになりました。既定の設定ではその中身が空なので、途中経過を利用者の画面に流している仕組みでは、ツールを呼ぶ間だけ表示が止まったように見えます。表示を戻すには、途中経過を返す表示設定に変えます。

なお、Opus 4.7 以前のモデルから直接移る場合は、Opus 5 のときに入った変更(応答の書き出しを先に指定しておく書き方の廃止など)も合わせて直す必要があります。移行ガイドは、先に Opus 5 への移行手順を済ませてから Opus 5.5 の手順に進むよう書いています。Claude Code には、この書き換えをまとめて行う /claude-api migrate というコマンドも用意されています。

一部の依頼は、安全対策で別のモデルに回る

Opus 5.5 には、サイバーセキュリティに加えて、生物学の分野の安全対策が新たに付きました。こうした分野の依頼では、Opus 5.5 が答えずに断る(API では停止理由が refusal になる)ことがあります。

断ったあとの扱いは使い方で変わります。発表ページは、サイバーセキュリティの作業の多くは Opus 4.8 に回されると書いています。API で使う場合は、断られたときに Anthropic が勧めるモデルへ自動で回し直す設定(試験提供)を入れるか、自分で別のモデルに送り直す処理を書くよう、移行ガイドが求めています。生物学の研究で Opus 5.5 を使いたい組織には、審査を経て使えるようにするプログラムが別に用意されています。

ベンチマークの注記にある「別のモデルが代わりに解いた」も同じ仕組みです。評価では、安全対策が働いたサイバーセキュリティの課題を Opus 4.8 が、生物学と最先端の AI モデル開発に関わる課題を Opus 5 が解いています。API では、回し直す設定を入れていなければ、断られた結果がそのまま返ります。社内のセキュリティ診断や脆弱性の調査に Opus 5.5 を使っている場合は、断られたときにどのモデルが答えるのかを把握しておいてください。

もう 1 つ、Opus 5.5 は考えた内容を本文に書き出させようとする依頼も断ることがあります。この種の断りは、自動で別のモデルに回し直す設定の対象外で、そのまま利用者に返ってきます。

使える場所と、契約プランへの影響

項目内容
提供先Claude の API、Amazon Bedrock、Claude Platform on AWS、Google Cloud、Microsoft Foundry
入力できる量と出力の上限100 万トークンまで入力でき、1 回の出力は 12 万 8,000 トークンまで。Opus 5 と同じ。
知識の範囲2026 年 6 月まで。Fable 5.1 と同じ。
これまでの Opus と同じく使える
対象外。この枠自体、新規の購入は受け付けていない。
提供終了2027 年 9 月 22 日より前には終了しない(Claude の API、Claude Platform on AWS、Microsoft Foundry での約束。Amazon Bedrock と Google Cloud は各社が日付を決める)

表の中で、会社で使うときに効いてくるのはゼロデータ保持と Priority Tier の 2 つです。送った内容を保存させない扱いが要件になっている会社でも、Opus 5.5 は使えます。一方で、混雑時の優先枠が要る業務には使えません。ただ、この優先枠はすでに新規に買えなくなっているので、今から選ぶ理由にはなりにくいはずです。

Claude のアプリを契約している方への影響もあります。Pro、Max、Team と、席数で契約する Enterprise では、5 時間ごとの利用上限が引き上げられました。あわせて、利用上限をリセットできる権利が契約者に 1 回分配られ、好きなときに取っておいて使えるようになっています。各プランの料金と上限はClaude の料金ガイド、モデルごとの違いはClaude のモデル比較ガイドで整理しています。

今後の予定として、Sonnet 5.5 と Haiku 5.5 が数週間以内に出ると発表されています。性能、効率、安全面で同じような改善が入る、とされています。Sonnet や Haiku を大量に回している業務では、Opus に上げるかどうかをその発表を見てから決めても遅くありません。

明日から変えること

最後に、立場ごとにやることを並べます。どれも 1 日で済む作業です。

  • Claude Code を使っている人は、普段の作業を 1 つ選び、切り替わる前の結果と見比べてください。物足りなければ effort を上げます。設定ファイルの一番上の階層に書いた effort の既定値は Opus 5.5 に効かない点に注意してください。
  • API を組み込んでいる開発担当の人は、モデル名を変える前に、考える処理を切る指定、ツールを強制する指定、会話の書き換え、旧版のパソコン操作ツールの 4 つがコードに無いかを検索してください。そのうえで effort を明示し、段階ごとに費用と品質を測り直します。
  • 費用を管理している人は、キャッシュの読み出し単価が 6 割下がった点を試算に入れてください。Claude Code のように同じ資料を何度も読む使い方ほど、請求額が大きく下がります。
  • Fable 5.1 を使っている人は、同じ作業を Opus 5.5 で試してください。足りれば費用は 4 割です。Anthropic 自身が「差はスコアほど大きくない」と書いています。

ベンチマークの数字は、どのモデルを試すかを決める材料にはなります。ただ、Anthropic 自身がそう書いているとおり、この水準の差は自社の業務で試さないと分かりません。価格が下がった今は、試すための費用も下がっています。

Claude を業務に組み込むところからご一緒します

たとえば「API のモデルを切り替えたいが、どこがエラーになるか洗い出せていない」「Claude Code の利用が広がって費用の見通しが立たない」といった場面で、既存の業務フローへの AI エージェントの組み込み設計と実装、AI が使えるように社内に散らばったデータを整える作業、社外にデータを出せない会社向けのオンプレミス環境での生成 AI 導入までご支援しています。

AI 活用の進め方を相談する