N&S Logo

Claude Sonnet 5.5 の性能と料金を比較|Sonnet 5・Opus 5.5・Fable 5.1 と実測

更新: 9/30
読了: 約37分
字数: 14,509文字
Claude Sonnet 5.5 の性能と料金を比較|Sonnet 5・Opus 5.5・Fable 5.1 と実測

当社は Sonnet 5.5・Sonnet 5・Opus 5.5・Opus 5・Fable 5.1 を effort high に揃え、小さな Node.js の 6 課題を各 3 回 (計 90 回)、Claude Code 2.1.285・2.1.283 の非対話モードで 2026年9月28日と2026年9月30日 (日本時間) に解かせました。当社の実測では 5 つのモデルすべてが 18/18 で成功し、成功率では差がつきませんでした。Opus 5 を基準にした 1 回あたりの中央値の比は、Sonnet 5.5 が時間 0.35 倍・費用 (API 定価換算) 0.28 倍、Opus 5.5 が時間 0.50 倍・費用 0.60 倍でした。Fable 5.1 は時間が 0.63 倍 (6 課題のうち 4 課題で短く、2 課題はばらつきの範囲) で、費用は 6 課題すべてで大きく 1.34 倍でした。

Sonnet 5.5 は Opus 5 より速くて安い?実測結果の要約

Claude Code 2.1.285・2.1.283 で、Sonnet 5.5・Sonnet 5・Opus 5.5・Opus 5・Fable 5.1 に同じ 6 つの課題を各 3 回解かせた結果です (effort はすべて high、2026年9月28日・2026年9月30日 (日本時間) に実行)。時間・ターン数・ツール呼び出し・出力トークン・費用は 1 回あたりの中央値 (失敗した回も含む) で、比は Opus 5 の中央値に対する比です。括弧の「既定」は、その effort がモデルの既定の値であることを示します。

モデル (effort)成功時間ターン / ツール呼び出し出力トークン費用 (API 換算)Opus 5 との比 (時間 / 費用)
Sonnet 5.5 (high・既定)18/1821 秒9 / 82,602$0.070.35 倍 / 0.28 倍
Sonnet 5 (high・既定)18/1834 秒10.5 / 9.53,731$0.100.55 倍 / 0.41 倍
Opus 5.5 (high)18/1831 秒8 / 73,355$0.150.50 倍 / 0.60 倍
Opus 5 (high・既定)18/1862 秒10 / 94,300$0.25基準
Fable 5.1 (high・既定)18/1839 秒9 / 83,147$0.340.63 倍 / 1.34 倍

この 6 つの課題では、どのモデルでも成功数が同じでした。費用は Claude Code が記録した API の定価換算の値で、請求額ではありません。実行は Claude の Max プラン (サブスクリプション) で行いました。出力トークンは思考のトークンを含みます。

課題の中身と課題ごとの結果

どのモデルにも、同じ初期ファイル (外部の依存の無い小さな Node.js のプロジェクト) と同じプロンプト (英語) を渡しました。課題は次の 6 つです。

  • 課題 1「時間の文字列を秒に変える関数を仕様どおりに直す」: 時間の文字列 (単位 d・h・m・s つきの整数を並べたもの) を秒に変える関数が、仕様 (大きい単位から順に各 1 回まで、符号・小数は不可、不正な入力はエラー) を満たさず、テストが落ちている。関数を直して仕様をすべて満たす。 (採点は元からあるテスト 3 件と隠しテスト 20 件)
  • 課題 2「CSV の 1 行を仕様どおりに分ける関数を書く」: 区切り文字の指定、二重引用符の中の区切り文字と「""」、空白を削らないこと、末尾の空の欄、不正な引用符や区切り文字のエラーなど 7 項目の仕様から、CSV の 1 行を文字列の配列に分ける関数を実装する。 (採点は元からあるテスト 2 件と隠しテスト 21 件)
  • 課題 3「重複した割引の処理を別のモジュールに切り出す」: カートの合計を計算する関数で、会員と非会員の 2 つの分岐に同じ割引コードの処理が重複している。割引だけを計算する純粋な関数を新しいモジュールに切り出し、どの入力でも計算結果を変えずに置き換える。 (採点は元からあるテスト 2 件と隠しテスト 82 件)
  • 課題 4「コマンドライン引数の解析の不具合 4 件を直す」: 利用者から報告された 4 件 (「--」の後ろの引数、「=」を 2 つ含む値、空の値、単独の「-」) の不具合を、ほかの動作を変えずに直し、直した動作のテストを新しいファイルに足す。 (採点は元からあるテスト 2 件と隠しテスト 12 件)
  • 課題 5「在庫と注文の 2 つのモジュールにまたがる不具合を直す」: 在庫 (商品コードごとの引き当てと戻し) と注文 (全部を引き当てられなければ全部を戻す) のモジュールが仕様書どおりに動かず、結合テストが落ちている。原因を見つけてソースを直す。 (採点は元からあるテスト 3 件と隠しテスト 19 件)
  • 課題 6「金額を小数のドルから整数のセントに移行する」: 移行の手順書に従い、金額の書式・カート・請求書・売上の集計など複数のモジュールを、浮動小数のドルから整数のセントの API に移す。テストの無い呼び出し元も含めて移し、生成されたデータのファイルは書き換えない。 (採点は元からあるテスト 4 件と隠しテスト 66 件)

課題ごとの結果です。各セルは「成功数・時間の中央値・費用の中央値 (API 換算)」です。

課題Sonnet 5.5 (high・既定)Sonnet 5 (high・既定)Opus 5.5 (high)Opus 5 (high・既定)Fable 5.1 (high・既定)
課題 13/3・17 秒・$0.063/3・46 秒・$0.153/3・19 秒・$0.103/3・33 秒・$0.193/3・24 秒・$0.23
課題 23/3・22 秒・$0.063/3・32 秒・$0.103/3・26 秒・$0.123/3・64 秒・$0.223/3・32 秒・$0.30
課題 33/3・16 秒・$0.053/3・17 秒・$0.063/3・40 秒・$0.193/3・59 秒・$0.263/3・68 秒・$0.35
課題 43/3・22 秒・$0.073/3・24 秒・$0.083/3・30 秒・$0.153/3・38 秒・$0.193/3・41 秒・$0.29
課題 53/3・23 秒・$0.083/3・36 秒・$0.123/3・50 秒・$0.253/3・115 秒・$0.353/3・42 秒・$0.43
課題 63/3・40 秒・$0.133/3・62 秒・$0.193/3・82 秒・$0.353/3・119 秒・$0.553/3・76 秒・$0.68

Sonnet 5.5 は Sonnet 5 と何が違う?課題ごとの成功数

当社の実測 (effort high・6 課題×各 3 回) では、Sonnet 5.5 と Sonnet 5 はどちらも 18/18 で成功し、Opus 5.5・Opus 5・Fable 5.1 を含む 5 つのモデルすべてが 6 つの課題のどれでも 3/3 で、成功数に違いはありませんでした。公式の文書では、Sonnet 5.5 の API の料金は Sonnet 5 と同じ入力 $2・出力 $10 / MTok で、知識の区切りは Sonnet 5.5 が Jun 2026、Sonnet 5 が Jan 2026 です。

成功数に差が出た課題はなかった

成功の条件は、元からあるテストと隠しテストの両方が通り、元のテストと保護したファイルを書き換えていないことです。隠しテストはモデルが実行中に見られず、課題 3 (重複した割引の切り出し) では 82 件、課題 6 (ドルからセントへの移行) では 66 件あります。今回の課題は、5 つのモデルにとって成功率の上限に近い難しさでした。成功数で能力の差を見分けられる課題ではなかった、というのが当社の実測の 1 つ目の結果です。

成功数以外に見えた違い

当社の実測では、成功までの進め方に違いが見えました。1 回あたりの中央値で、Sonnet 5.5 はターン数 9・ツール呼び出し 8 回、Sonnet 5 はターン数 10.5・ツール呼び出し 9.5 回でした。思考 (thinking) のトークンの中央値は Sonnet 5.5 が 318、Sonnet 5 が 754 です。

課題ごとに見ると向きはそろっていません。

  • 課題 1 (時間の文字列を秒に変える関数) では、Sonnet 5 のターン数が 14 (10〜14)、Sonnet 5.5 が 7 (7〜8) で、思考のトークンも Sonnet 5 が 1,217、Sonnet 5.5 が 334 でした。
  • 課題 3 (重複した割引の切り出し) では逆に、Sonnet 5.5 のターン数が 8 (8〜9)、Sonnet 5 が 6 (6) で、Sonnet 5 の方が少なく済みました。
  • 課題 6 (ドルからセントへの移行) はどのモデルでもターン数が最も多い課題で、中央値は Sonnet 5.5 が 18、Sonnet 5 が 20、Opus 5 が 24 でした。

Anthropic の発表では、初期の試用者の比較で Sonnet 5.5 は Sonnet 5 よりツール呼び出しをまとめて行い、手順が少なくなったとされています。当社の実測の全課題の中央値は同じ向きですが、課題 3 のように逆の課題もあり、課題ごとに 3 回の比較なのでこの違いを発見としては扱いません。

公式の文書にある Sonnet 5 との違い

Claude Sonnet 5.5 のページとClaude Sonnet 5 のページによれば、仕様の違いは次のとおりです。

  • 知識の区切り (Reliable knowledge cutoff) は Sonnet 5.5 が Jun 2026、Sonnet 5 が Jan 2026。
  • Sonnet 5 はレガシーのモデルになり、ページには Sonnet 5.5 への移行を検討するよう書かれています。
  • Sonnet 5 で動いているコードに影響する変更が 5 つあります。前もって考える処理を切るにはbetween_toolsを使うこと、ツールの強制指定がエラーになること、思考のブロックがモデルと会話に結び付くこと、Claude API と Google Cloud で以前のコンピューター操作のツールcomputer_20251124を受け付けないこと、アドバイザーツールが Sonnet 5 などをアドバイザーとして受け付けないことです。
  • ツール呼び出しの間の文章が思考のブロックで返るようになり、それを利用者に流しているアプリケーションでは、表示の値を設定するかbetween_toolsで前もって考える処理を切らないと、ツール呼び出しの間は何も表示されなくなります。

性能については、Sonnet 5.5 の発表ではTerminal-Bench4.0 で Sonnet 5.5 が 70.6%、Sonnet 5 が 10.3% とされています。これは複雑で多段の作業のベンチマークで、当社の小さな 6 課題とは難しさが違います。当社の課題で成功数に差が出なかったことは、この発表の差を確かめたものでも否定したものでもなく、当社の課題が差を測れる難しさではなかった可能性があります。

Sonnet 5.5 の料金はいくら?Fable 5.1 より速い?

Sonnet 5.5 の API の料金は、公式の料金表で入力 $2・出力 $10 / MTok (Sonnet 5 と同じ) です。当社の実測 (effort high・6 課題×各 3 回) では 1 回の中央値が 21 秒・$0.07 (API 定価換算) で、Fable 5.1 の 39 秒・$0.34 より短く安く、Opus 5 との比は時間 0.35 倍・費用 0.28 倍でした。

公式の料金

Pricing のページによれば、ほかのモデルの料金 (1 MTok あたり) は次のとおりです。Sonnet 5.5 と Sonnet 5 のキャッシュの読み込みは、どちらも $0.20 です。

  • Opus 5.5: 入力 $4・出力 $20・キャッシュの読み込み $0.20

  • Fable 5.1: 入力 $10・出力 $50・キャッシュの読み込み $0.25

当社の費用の値は、Claude Code が記録したこの定価に換算した金額です。

時間の差はどの課題で出たか

当社の実測では、Sonnet 5.5 の時間は 6 つの課題すべてで Opus 5 より小さく、各回の範囲 (最小〜最大) も重なりませんでした。差が最も大きかったのは課題 5 (在庫と注文の不具合) で、比は 0.20 倍です。

Opus 5 より大きかった課題 (Sonnet 5 の課題 1、Fable 5.1 の課題 3・課題 4) は、どれも範囲が重なるばらつきの範囲です。Opus 5.5 は 6 つの課題すべてで小さく、範囲が重なったのは課題 3 だけでした。

費用の差

当社の実測では、Sonnet 5.5・Sonnet 5・Opus 5.5 はいずれも 6 つの課題すべてで費用が Opus 5 より小さく、範囲も重なりませんでした。18 回の合計は Sonnet 5.5 が $1.38、Sonnet 5 が $2.03 です。

Fable 5.1 は 6 つの課題すべてで Opus 5 より費用が大きく、範囲も重なりませんでした (18 回の合計 $7.07)。出力トークンは Opus 5 の 0.73 倍と少ない一方、費用は 1.34 倍でした。

出力トークンと生成の速さ

出力トークン (思考を含む) の Opus 5 との比は、Sonnet 5.5 が 0.61 倍 (5 つの課題で小さく 1 つで大きい) でした。

時間は CLI の起動から終了までの実時間です。API の時間 1 秒あたりの出力トークンは、実時間とは別の量として集計しました。当社の実測での Opus 5 との比は、Sonnet 5.5 が 1.78 倍 (6 つの課題すべてで大きく、範囲も重ならない)、Sonnet 5 が 1.36 倍、Opus 5.5 が 1.40 倍でした。Fable 5.1 (1.07 倍) は課題ごとの向きがそろわず、差としては扱いません。

Anthropic の発表と合うか

Sonnet 5.5 の発表では、Sonnet 5.5 は Sonnet 5 より 30% 以上速く動き、多くの作業で費用が最大 30% 安いとされています。当社は effort を両方とも high に揃えた小さな 6 課題 (各 3 回) で、API 定価換算の費用と、API の時間 1 秒あたりの出力トークンを比べました。当社の実測での API の時間 1 秒あたりの出力トークンの中央値は Sonnet 5.5 が 147.5、Sonnet 5 が 113.3 で、費用の中央値 ($0.07 と $0.10) とともに発表と同じ向きでしたが、発表と同じ条件で確かめたものではありません。

Opus 5.5 の発表では、Opus 5.5 は Opus 5 より実行費用が 40% 安いとされています。当社は effort を両方とも high に揃え (Opus 5.5 の既定は medium)、小さな課題の API 定価換算の費用で比べました。費用の比は 0.60 倍と同じ向きですが、発表と同じ条件で確かめたものではありません。

Sonnet 5.5 と Opus 5.5 はどっちがいい?

当社の実測 (effort high・小さな 6 課題×各 3 回) では、Sonnet 5.5 と Opus 5.5 の成功数はともに 18/18 で、1 回の中央値は Sonnet 5.5 が 21 秒・$0.07 (API 定価換算)、Opus 5.5 が 31 秒・$0.15 と、この規模の課題では Sonnet 5.5 で足りました。一方、公式の案内 (Models overview) は、迷ったら多くの作業を Opus 5.5 から始め、難しい推論や長時間のエージェント作業には Fable 5.1 を使うよう勧めており、当社はそうした条件を確かめていません。

当社の実測から言えること

言えるのは、今回の規模 (小さな Node.js の課題) と effort high の範囲では、成功数が同じで時間と費用の小さいモデルで足りた、ということです。

  • Sonnet 5.5 と Opus 5.5: 費用はどの課題でも Sonnet 5.5 が小さく、たとえば課題 5 (在庫と注文の不具合) では Sonnet 5.5 が $0.08 ($0.08〜$0.09)、Opus 5.5 が $0.25 ($0.24〜$0.26) でした。時間は課題によって近く、課題 1 の Opus 5.5 は 19 秒 (17〜25 秒) で Sonnet 5.5 と範囲が重なります。Opus 5.5 のターン数の中央値は 8・ツール呼び出しは 7 回で、課題 1 ではターン数 5 で済ませましたが、課題 3 (10 と 8)・課題 6 (20 と 18) では Sonnet 5.5 より多く、課題ごとの向きはそろいませんでした。
  • Opus 5 から Opus 5.5: 成功数は変わらず、時間と費用は 6 つの課題すべてで Opus 5.5 の方が小さくなりました。この規模の課題では、切り替えて成功数を失うことはありませんでした。
  • Sonnet 5 から Sonnet 5.5: 成功数は変わらず、時間と費用の中央値は 6 つの課題すべてで Sonnet 5.5 の方が小さくなりました。ただし、費用は課題 3・課題 6、時間は課題 3・課題 5・課題 6 で各回の範囲が重なり、ばらつきの範囲です。公式の料金表の単価は同じです。
  • Fable 5.1: 今回の課題では成功数の上積みがなく、費用は 5 つのモデルで最も大きくなりました。この規模の課題では、Fable 5.1 を選ぶ理由は当社の実測からは出てきません。

成功数が上限に近い課題だったため、「どのモデルでも同じ」とは言えません。安いモデルで足りたのは、この規模の課題での話です。

公式の案内

以下は Anthropic の文書と発表の案内で、当社は長時間のエージェント作業・大きなリポジトリ・ほかの effort では確かめていません。

  • Models overviewによれば、迷ったら多くの作業は Opus 5.5 から始め、難しい推論や長時間のエージェント作業、または Opus 5.5 を高い effort にしても評価が足りないときに Fable 5.1 を使います。
  • Choosing the right modelの選び方の表では、Sonnet 5.5 は日常のコーディング・エージェント・企業の作業で速さと能力が要るとき (コード生成・データ分析など)、Opus 5.5 は複雑なエージェントのコーディング (数時間の自律的なコーディングエージェント・大規模なリファクタリングなど)、Fable 5.1 は最も高い能力が要るとき (数時間続くエージェントのセッション・多段の深い調査など) に挙げられています。同じページは、モデルを替えるより effort を調整する方がよい手段であることが多いとも書いています。
  • Sonnet 5.5 の発表では、Sonnet 5.5 は範囲のはっきりした日常の作業や不具合の修正に強く、判断を持続させる複雑で自由度の高い作業では Opus 5.5 が引き続きはっきり強いとされています。また Sonnet 5.5 は低い effort で動かすときに Opus 5.5 を最もよく補うとされています。
  • Effort のページによれば、Sonnet 5.5 のエージェントのコーディングでは、仕様のはっきりした課題は medium から始め、難しい課題や長い課題で high に上げるよう勧めています。当社は high だけで測ったので、medium での結果は分かりません。

今回の課題は、仕様が README などに書かれた範囲のはっきりした小さな作業で、公式の案内が Sonnet 5.5 に向くとする種類の作業に当たります。当社の実測はその案内と矛盾しませんが、Opus 5.5 や Fable 5.1 が向くとされる長く複雑な作業での比較にはなっていません。

Sonnet 5.5 の使い方は?Claude Code とモデル ID

Sonnet 5.5 は、Claude Code ではセッション中の/model・起動時の--model・設定ファイルのmodelのどれかで選べ、API のモデル ID はclaude-sonnet-5-5です。effort は/effort・--effort・設定で変えられ、Sonnet 5.5 の既定の effort は Claude Code ではmedium、Claude API ではhighです。

Claude Code の操作はModel configuration のページの案内によります。

Claude Code でモデルを選ぶ

  • セッション中の /model:/model <alias|name>ですぐに切り替わり、引数なしで打つと選択画面が開きます。選んだモデルは新しいセッションの既定として保存されます。選択画面でsを押すと、そのセッションだけが切り替わります。
  • 起動時の --model:claude --model <alias|name>で起動するときに指定します。
  • 設定ファイルの model: 設定ファイルに書くと、以後も続けて効きます。
claude --model opus
/model sonnet

effort を設定する

Sonnet 5.5 で選べる effort はlow・medium・high・xhigh・maxです。

  • /effort: 引数なしで打つとスライダーが開き、レベル名を続けるとそのレベルになります。Enter で既定として保存し、sでそのセッションだけに効きます (sは Claude Code v2.1.257 以降)。
  • --effort: 起動時に渡したレベルは、明示的な指定として使われます。
  • 設定:modelSettingsでモデルごとのレベルを、effortLevelでレベルを決めていないモデルの既定を設定します。maxはどちらのキーにも書けません。

ユーザー設定の最上位に書いたeffortLevelは、Opus 5.5 とそれより後に出たモデル (Sonnet 5.5 を含む) には効きません。

API のモデル ID

Models overviewによれば、Claude API の ID は Sonnet 5.5 がclaude-sonnet-5-5、Opus 5.5 がclaude-opus-5-5、Fable 5.1 がclaude-fable-5-1です。レガシーの Sonnet 5 は、Sonnet 5 のページによればclaude-sonnet-5です。

前のモデルから切り替えるときの effort

  • Opus 5 から Opus 5.5: Model configuration のページは、Opus 5 で使っていたレベルを持ち越さず、Opus 5.5 の既定のmediumから始めるよう案内しています。
  • Sonnet 5 から Sonnet 5.5:Effort のページによれば、Sonnet 5.5 のレベルは調整し直されているため、Sonnet 5 の設定を持ち越さず、自分の評価でレベルを測り直すよう勧めています。
  • API で思考を切っていた場合: Sonnet 5.5 では"disabled"の代わりにthinking: {"type": "between_tools"}を送ります。この設定はlow・medium・highで使えます。

Sonnet 5.5 の比較で分からないことは?

当社の実測 (effort high・小さな Node.js の 6 課題×各 3 回) では Sonnet 5.5 を含む 5 つのモデルすべてが 18/18 で成功したため、この比較からは難しい課題での Sonnet 5.5 とほかのモデルの能力の差は分かりません。effort も high に固定したので、ほかの effort での結果も分かりません。

成功数が同じだったことの意味

  • モデルを変えても成功数は変わらなかった: 当社の実測では、この 6 つの課題でどのモデルを選んでも成功数は同じでした。effort を変えたときの成功数は測っていません。
  • 差を見るにはもっと難しい課題が要る:Effort のページは、high を複雑な推論や難しいコーディングの課題に向くとしています。Spending your effortの記事は、effort が検証やエッジケースの確認の量を調整する手段で、検証やエッジケースの確認が有用なハードウェア・コードレビュー・セキュリティなどの領域で高い effort の結果が良かったと書いています。記事の例では、HTML から JavaScript を取り除く課題で Fable 5.1 が low の 1/5 から xhigh の 5/5 に上がっています。
  • したがって言えないこと: この結果から「low や medium の effort で常に足りる」「どのモデルでも同じ」とは言えません。

回数と課題の規模

回数は課題ごと・モデルごとに 3 回、モデルごとに 18 回、全体で 90 回で、統計的な検定はしていません。課題はどれも依存の無い小さな Node.js の課題で、成功率は上限に近い結果でした。利用上限や起動の失敗で集計から外した回は、どのモデルも 0 回です。

effort を固定したこと

Models overviewなどの公式の文書によれば、API での既定の effort は Opus 5.5 だけが medium で、ほかの 4 つのモデルは high です。Model configuration のページによれば、Claude Code では Sonnet 5.5 と Opus 5.5 の既定が medium です。そのため Opus 5.5 はどちらでも、Sonnet 5.5 は Claude Code で、既定より 1 つ上のレベルで測ったことになり、既定のまま使ったときの時間と費用はこの比較と違う可能性があります。

要約の表と課題ごとの表の「既定」の印は Claude API の既定の effort によるもので、Claude Code での Sonnet 5.5 の既定 (medium) とは違います。

費用・版・日付

費用は API の定価に換算した値で、請求額ではありません。実行は Claude の Max プラン (サブスクリプション) にログインした Claude Code で行い、API キーは使っていません。CLI は Claude Code 2.1.285 と 2.1.283 の記録を合わせたもので、実行日は 2026年9月28日と2026年9月30日 (日本時間) です。ほかの版や日付での結果は確かめていません。

権限の自動判定で拒否されたコマンド

自動で許可されない操作は拒否する設定だったため、一部のコマンドが実行されずに拒否されました (成否は採点の結果だけで決めています)。拒否された回数は、各 18 回の試行のうち Sonnet 5.5 が 12 回 (12 回の試行で)、Sonnet 5 が 3 回 (3 回の試行で)、Opus 5.5 が 12 回 (12 回の試行で)、Opus 5 が 1 回 (1 回の試行で)、Fable 5.1 が 7 回 (6 回の試行で) です。理由はヒアドキュメントを含むコマンド、自動では許可されない形のコマンド、作業環境の外のパスでした。これが時間やターン数に与えた影響は測っていません。

再現方法

比較は次の条件で行いました。同じ条件で、ほかのモデルや effort でも比べられます。

  • 課題ごとに同じ初期ファイルと同じプロンプトを渡し、Claude Code 2.1.285・2.1.283 の非対話モード (claude -p) でモデルの ID だけを変えて解かせる。effort は明示して指定する (すべて high)。
  • 回数は課題 6 つ × モデル 5 つ × 各 3 回。試行の順番は反復と課題ごとにモデルの並びを回す。
  • 1 回の上限は 60 ターン・20 分・API 換算 $5 (安全のための上限)。
  • ユーザー・プロジェクトの設定とCLAUDE.mdを読まない (--setting-sourcesに空を渡す)。自動メモリは切る (autoMemoryEnabled: false)。MCP サーバーは使わない (--strict-mcp-config)。
  • 使えるツールは Bash・Read・Write・Edit・Glob・Grep。許可の確認はせず、自動で許可されない操作は拒否する (--permission-mode dontAsk)。
  • Bash はサンドボックスの中で動く: ネットワークはすべて拒否、ホームディレクトリの下で読めるのは作業ディレクトリと一時ディレクトリだけ (課題の置き場と隠しテストは読めない)。
  • ファイルの書き換え (Edit) は作業ディレクトリの中だけ。
  • セッションは保存しない (--no-session-persistence)。スラッシュコマンドは使わない (--disable-slash-commands)。
  • 成功 = 元からあるテストと隠しテストの両方が通り、元のテストと保護したファイル (生成データなど) を書き換えていないこと。
  • 元のテストは初期の版に戻してから実行する (モデルがテストを書き換えて通したことにならないように)。
  • 隠しテストは採点のときだけ作業ディレクトリの外から持ち込む (モデルは実行中に見られない)。
  • モデルが自分で足したテストは合否に使わない。

1 回の試行のコマンドの形です (<…> は置き換える部分。プロンプトは標準入力で渡します)。

claude -p --model '<モデルの ID>' --effort high --output-format stream-json --verbose --tools Bash,Read,Write,Edit,Glob,Grep --permission-mode dontAsk --settings '<隔離とサンドボックスの設定 (JSON)>' --strict-mcp-config --setting-sources '' --no-session-persistence --disable-slash-commands --max-turns 60 --max-budget-usd 5 < '<課題のプロンプト>'

出典

📱 関連ショート動画

この記事の内容をショート動画で解説

横にスクロールできます

著者について

原田賢治

原田賢治

代表取締役

Mike King理論に基づくレリバンスエンジニアリング専門家。生成AI検索最適化、ChatGPT・Perplexity対応のGEO実装、企業向けAI研修を手がける。15年以上のAI・システム開発経験を持ち、全国で企業のDX・AI活用、退職代行サービスを支援。