同じベンチマークなのに数字が違う — OpenAI・Google・Anthropic の公式発表を突き合わせて分かったこと
発端:Terminal-Bench 4.0 の数字が合わない
Terminal-Bench 4.0 は、ターミナル上での複雑な作業を評価するベンチマークです。OpenAI と Anthropic がどちらも公式ページに載せています。同じ表にすると、こうなります。
| モデル | Anthropic発表 | OpenAI発表 | 差 |
|---|---|---|---|
| Claude Fable 5.1 | 55.8% | 55.8% | 0 |
| GPT-5.6 Sol | 37.3% | 37.3% | 0 |
| Claude Opus 5 | 52.3% | 52.6% | 0.3 |
| Claude Fable 5 | 42.0% | 44.5% | 2.5 |
Fable 5.1 と Sol は完全に一致しているのに、Fable 5 だけ2.5ポイントずれています。
もっと妙なこと:OpenAIが自社モデルを低く書いている
AutomationBench(業務ワークフローの評価)でも同じことが起きます。
| モデル | Anthropic発表 | OpenAI発表 | 差 |
|---|---|---|---|
| Claude Fable 5.1 | 31.4% | 31.4% | 0 |
| Claude Opus 5 | 26.9% | 26.9% | 0 |
| Claude Fable 5 | 17.1% | 17.4% | 0.3 |
| GPT-5.6 Sol | 19.6% | 18.1% | 1.5 |
GPT-5.6 Sol は OpenAI 自身の製品です。それを、OpenAI は Anthropic より1.5ポイント低く書いています。
自社を良く見せたいなら逆になるはずです。つまりこれは印象操作ではなく、測定条件の違いがそのまま出ていると考えるのが自然です。
なぜズレるのか
各社の注記を読むと、理由が書いてあります。
Anthropic の注記:
「Fable 5.1 は本番用のセーフガードを有効にした状態で評価された。セーフガードが介入したタスクでは、Fable 5.1 と Fable 5 は OSWorld 2.0 でゼロ点、Fable 5 は AutomationBench でもゼロ点となった。(中略)これはおそらく Fable 5.1 と Fable 5 の性能を下げている」
つまり自社モデルに不利な条件で測って、そう明記しているわけです。
OpenAI の注記:
「他社モデルを横断してテストする際は、よりシンプルな研究用セットアップを使用している。Codex はより複雑な本番構成を持っており、それが生のモデルのエラー率を変えることがある」
Anthropic の別の注記(Terminal-Bench-Science 0.1):
「標準誤差はモデルあたり ±3.5〜4.5ポイント。公開リーダーボードは Claude Opus 5 を30.0%、Claude Fable 5 を21.4%と報告しているが、我々のセットアップではそれぞれ29.0%、24.7%で再現された。いずれもノイズの範囲内」
標準誤差が±3.5〜4.5ポイントあるベンチマークで、1〜2ポイントの差を比べても意味がない、と発表元自身が書いています。
結論:数字の読み方を変える必要がある
公式データから言えることは3つです。
- 1〜2ポイント差は無意味。 測定条件と誤差の範囲に収まる
- 各社は自社が勝つベンチマークを選んで載せている。 Google は Terminal-Bench 4.0 に触れず(同じ表で Gemini 3.8 Flash は19.1%)、OpenAI は DeepSWE の優位に触れない(同じ表で Gemini 3.8 Flash が73.8%、GPT-6 Astra が74.1%)
- セーフガードの有無で数字が変わる。 Anthropic は「介入したタスクはゼロ点」と明記しており、同社の公開値は保守的
では何を見るべきか:価格で並べる
ベンチマークより、価格と提供条件のほうが判断材料になります。ここは各社が明確に書いています。
| モデル | 入力($/1M) | 出力($/1M) | 備考 |
|---|---|---|---|
| GPT-6 Astra | $10 | $50 | Fast modeは2倍速・2倍価格。キャッシュは別料金 |
| Claude Fable 5.1 | $10 | $50 | キャッシュ読み取りが$0.25(75%値下げ) |
| Gemini 3.8 Flash | $0.75 | $3.75 | 初期提供価格 |
GPT-6 Astra と Claude Fable 5.1 は、単価が完全に同一($10 / $50)です。 一方で Gemini 3.8 Flash は桁が1つ違います。
実質コストは単価では決まらない
ここが一番実務的な話です。3社とも「単価ではなく1タスクあたりの総額で見てほしい」と主張していますが、根拠がそれぞれ違います。
Anthropic(Fable 5.1)— キャッシュ読み取りの値下げ
キャッシュ読み取りを $0.25 / 100万トークン(75%減) にしたことで、
- 一般的なワークロード: 約 25%減
- エージェント的な作業: 最大 約45%減
Cognition の Walden Yan 氏のコメントが具体的です。
「新しいキャッシュ読み取り価格で、Fableクラスのモデルが、これまで Opus に残していたワークロードでもようやく経済的になった」
Google(Gemini 3.8 Flash)— トークン消費が増えうる
逆方向の注意です。公式にこう書かれています。
「特にエフォート レベルを高く設定した場合には、パフォーマンスを最大限に引き出すために、より多くのトークンを消費することがあります」
単価が安くても、消費量が増えれば実コストは上がります。Google自身が「効率重視なら 3.7 Flash を使い続ける選択肢もある」と書いています。
OpenAI(GPT-6 Astra)— 出力トークンが少なく済む
複数のベンチマークで「同等以上のスコアを、より低い推定APIコストで」と主張しています。
- Terminal-Bench 4.0: Fable 5.1 より約63%低い推定コスト
- BenchCAD: Fable 5.1 より約86%低い推定コスト
3社の方向性の違いが一番出ているのはセキュリティ
同じ時期に、3社が正反対に近い設計判断をしています。ここは公式発表を読まないと分かりません。
| 方針 | 具体的な内容 | |
|---|---|---|
| OpenAI | 攻撃能力が Critical に到達、その上で制限 | ExploitBench 100%。Preparedness Framework の Critical しきい値に到達。評価中に未知のゼロデイを2件発見。通常提供版は高度なセキュリティ作業を拒否 |
| 最初から修正側に投資 | 「悪用などの攻撃的な機能よりも修正を優先した」と明記。Flash Cyber は Fairwind Program 経由で政府機関・重要インフラ等にのみ提供 | |
| Anthropic | 誤検知を減らして使いやすく | サイバーセーフガードの誤検知を60%削減。脆弱性の発見は許可、悪用コードの開発は不可。侵入テスト・エクスプロイト生成は Opus へ迂回 |
同じ「安全性」でも、OpenAIは能力を高めてから止める、Googleは最初から攻撃側を作らない、Anthropicは正当な作業を邪魔しないことを優先する。 設計思想がはっきり分かれています。
見落とされている重要な変更(EU AI Act)
Anthropic の発表には、ベンチマークとは無関係だが実務的に大きい話が入っています。
- Anthropic は190社以上とともに EU AI Act の透明性行動規範に署名
- 2026年8月2日以降にリリースされたモデルの出力に電子透かしを追加することが求められた
- この透かしは検出APIを持たない人には見えない。出力の品質や内容には影響せず、ユーザーや組織の情報も含まない
- 検出APIは現在プライベートプレビューで、規制当局・報道機関・ファクトチェッカー・研究者・EU市民社会団体などに提供
AI生成テキストの判別が、規制ベースで実際に動き始めています。 この点に触れている解説はほとんど見かけません。
もう1つ、開発者に直接影響する変更があります。
「新規APIアカウント(本日以降に作成されたもの)では、マルチターン会話における Claude の以前のコンテキストを、Claude の以前の思考の記録を保ったまま手動で編集することはできなくなりました」
蒸留(distillation)対策です。既存アカウントは当面影響を受けませんが、将来のモデルリリースで全ユーザーに適用されると明記されています。カスタム統合を組んでいる場合は確認が必要です。
どう選ぶか
| 状況 | 候補 | 理由 |
|---|---|---|
| コストを1桁下げたい | Gemini 3.8 Flash | 単価 $0.75/$3.75。DeepSWE では Astra と0.3ポイント差 |
| キャッシュを多用するエージェント | Claude Fable 5.1 | キャッシュ読み取り$0.25。エージェント作業で最大45%減 |
| コンピュータ操作の自動化 | GPT-6 Astra | ScreenSpot-Pro 92.7%、OSWorld で47%の時間短縮 |
| ターミナル作業 | Astra か Fable 5.1 | Gemini 3.8 Flash は19.1%と弱い |
| セキュリティ業務 | 用途で分かれる | 発見中心なら Fable 5.1、パッチ生成なら Flash Cyber(要Fairwind)、Astraは拒否が多い |
| コストを固定したい | Gemini 3.7 Flash | 3.8はトークン消費が増えうると公式に明記 |
一次ソース
この記事は、本文末尾に挙げた各社の公式発表・公式ドキュメントを突き合わせて AI(Anthropic Claude)が下書きし、運営者が数値と内容を確認したうえで掲載しています。 数値は掲載時点の公式資料にもとづきます。最新の条件は各社の公式ページをご確認ください。
主な一次情報(公式発表)を開く


