Gemini 3.8 Flash は本当に「フロンティア級」か — GoogleとOpenAI、両社の公式ベンチマークを突き合わせる
Googleの発表内容
Gemini 3.8 Flash は 3.7 Flash の3週間後に公開されました。同時に、サイバーセキュリティ特化の Gemini 3.8 Flash Cyber も発表されています。両者は「異なる運用環境に合わせて最適化されているが、同一の基盤知能を備えている」とされています。
| 項目 | 内容 |
|---|---|
| 公開日 | 2026年9月3日 |
| 入力価格 | $0.75 / 100万トークン(初期提供価格) |
| 出力価格 | $3.75 / 100万トークン(初期提供価格) |
| 提供 | Google AI Studio、Gemini API、Antigravity、Android Studio、Gemini Enterprise、Geminiアプリ(AI Pro / Ultra) |
Googleが挙げた性能面の根拠:
- DeepSWE v1.1(長期的なソフトウェアエンジニアリング)で「より大規模なフロンティアモデルの多くを上回りながら、コストはほんのわずか」
- HLE-Verified 54.9%
- Vals Finance Agent V2、Harvey社の Legal Agent Benchmark で 3.7 Flash や他のフロンティアモデルを上回る
ここが重要:OpenAIの公式表と突き合わせる
OpenAI は GPT-6 Astra の発表ページに、Gemini 3.8 Flash を含む比較表を載せています。同じベンチマーク名で並べると、こうなります。
| ベンチマーク | Gemini 3.8 Flash | GPT-6 Astra | 差 |
|---|---|---|---|
| DeepSWE v1.1 | 73.8% | 74.1% | わずか0.3ポイント |
| GPQA Diamond | 95.3% | 96.0% | 0.7ポイント |
| Artificial Analysis Intelligence Index v4.1.1 | 58.7 | 61.2 | 2.5ポイント |
| Artificial Analysis Coding Agent Index v1.4 | 61.2 | 67.0 | 5.8ポイント |
| Terminal-Bench 4.0 | 19.1% | 57.9% | 38.8ポイント |
※この表の数値はOpenAIが測定・公表したものです。Googleが自社で測った条件とは異なる可能性があります。
DeepSWE v1.1 では Gemini 3.8 Flash($0.75/$3.75)が GPT-6 Astra($10/$50)と0.3ポイント差です。入力単価で約13分の1、出力単価で約13分の1の価格でこの差、というのがGoogleの主張の実体です。この一点だけ見れば「フロンティア級」は誇張ではありません。
一方で Terminal-Bench 4.0 では 19.1% 対 57.9% と3倍の開きがあります。Googleの発表ページに Terminal-Bench 4.0 の数字は出てきません。OpenAIの発表ページに DeepSWE の優位は書かれていません。両社とも、自社が勝つベンチマークを選んで載せています。
では実際に何ができるのか
公式資料を素直に読むと、Gemini 3.8 Flash の位置づけはこうなります。
強い領域
- 長期的なソフトウェアエンジニアリング(DeepSWE系)— フロンティアモデルと互角、価格は1桁違う
- 金融・法務といった専門ドメインの分析とレポート作成
- プロンプトインジェクション耐性(Gray Swan の測定で「飛躍的に向上」)
弱い、または不明な領域
- ターミナル上の複雑なタスク(Terminal-Bench 4.0 で19.1%)
- コーディングエージェントの総合指標(61.2 対 Astra 67.0、Opus 5 68.1)
見落とされやすい設計上の注意点
Googleは性能向上の理由を「3.8 Flash がより熱心に処理に取り組む」と説明しています。複雑なタスクでは追加の推論ステップを実行し、ツールを繰り返し呼び出す設計です。
そして公式にこう書かれています。
「特にエフォート レベル(思考の深さの度合い)を高く設定した場合には、パフォーマンスを最大限に引き出すために、より多くのトークンを消費することがあります」
つまり単価が安くても、1タスクあたりの消費トークンが増えれば実コストは上がります。 Googleは対策として「計算効率が最優先の用途ではエフォートレベルを低く設定する」「効率重視なら 3.7 Flash を使い続ける」という2つの逃げ道を明示しています。
価格表の単価だけで乗り換えを判断すると、請求額が想定と合わない可能性があります。
Gemini 3.8 Flash Cyber は誰でも使えるわけではない
同時発表の Flash Cyber は、Fairwind Program を通じて信頼できるパートナーにのみ提供されます。対象は政府機関、重要インフラ事業者、ソフトウェアメンテナーです。一般の開発者が今すぐ触れるものではありません。
公式が挙げた実績:
- CWE-Bench(自動パッチ適用)で pass@1 47.2%。主要フロンティアモデルの 47.8% とほぼ同等を、大幅に低いコストで達成
- Chrome セキュリティチームの検証で、より大規模な商用モデルと比べ 2.6倍の正確なパッチを生成
- Wiz の社内ペネトレーションテストで、他社比 2.3〜5.2倍低いコスト、再現率 +7.5〜9.7%
- Google Cloud の脆弱性調査チームが、通常なら数か月かかる重大な基盤脆弱性を2時間足らずで発見
Googleは設計方針として「悪用などの攻撃的な機能よりも修正を優先した」と明記しています。同時期の GPT-6 Astra が攻撃側の能力(ExploitBench 100%)で Critical しきい値に達したのとは、方向性が対照的です。
選び方の目安
| こういう人 | 推奨 |
|---|---|
| 長時間のコーディングエージェントを安く回したい | 3.8 Flash。DeepSWE でフロンティア級、価格は1桁下 |
| ターミナル操作中心の自動化 | 3.8 Flash は弱い。Terminal-Bench 4.0 で19.1% |
| コスト予測を固くしたい | 3.7 Flash を継続。3.8はトークン消費が増えうると公式に明記 |
| セキュリティ業務 | Flash Cyber は Fairwind Program 経由のみ。一般提供ではない |
価格に関する注意
公式ページでは入力$0.75 / 出力$3.75 が「初期提供価格」と脚注付きで表記されています。二次情報として「2027年1月1日から入力$1.50 / 出力$7.50に改定」と報じているメディアがありますが、Googleの公式ブログ本文では改定日を確認できませんでした。 長期のコスト計算をする場合は、公式の料金ページで最新の条件を確認してください。
一次ソース
この記事は、本文末尾に挙げた各社の公式発表・公式ドキュメントを突き合わせて AI(Anthropic Claude)が下書きし、運営者が数値と内容を確認したうえで掲載しています。 数値は掲載時点の公式資料にもとづきます。最新の条件は各社の公式ページをご確認ください。
主な一次情報(公式発表)を開く

