📊モデルリリースAI Daily Digest

Gemini 3.8 Flash は本当に「フロンティア級」か — GoogleとOpenAI、両社の公式ベンチマークを突き合わせる

Googleの発表内容

Gemini 3.8 Flash は 3.7 Flash の3週間後に公開されました。同時に、サイバーセキュリティ特化の Gemini 3.8 Flash Cyber も発表されています。両者は「異なる運用環境に合わせて最適化されているが、同一の基盤知能を備えている」とされています。

項目内容
公開日2026年9月3日
入力価格$0.75 / 100万トークン(初期提供価格)
出力価格$3.75 / 100万トークン(初期提供価格)
提供Google AI Studio、Gemini API、Antigravity、Android Studio、Gemini Enterprise、Geminiアプリ(AI Pro / Ultra)

Googleが挙げた性能面の根拠:

  • DeepSWE v1.1(長期的なソフトウェアエンジニアリング)で「より大規模なフロンティアモデルの多くを上回りながら、コストはほんのわずか」
  • HLE-Verified 54.9%
  • Vals Finance Agent V2、Harvey社の Legal Agent Benchmark で 3.7 Flash や他のフロンティアモデルを上回る

ここが重要:OpenAIの公式表と突き合わせる

OpenAI は GPT-6 Astra の発表ページに、Gemini 3.8 Flash を含む比較表を載せています。同じベンチマーク名で並べると、こうなります。

ベンチマークGemini 3.8 FlashGPT-6 Astra差
DeepSWE v1.173.8%74.1%わずか0.3ポイント
GPQA Diamond95.3%96.0%0.7ポイント
Artificial Analysis Intelligence Index v4.1.158.761.22.5ポイント
Artificial Analysis Coding Agent Index v1.461.267.05.8ポイント
Terminal-Bench 4.019.1%57.9%38.8ポイント

※この表の数値はOpenAIが測定・公表したものです。Googleが自社で測った条件とは異なる可能性があります。

DeepSWE v1.1 では Gemini 3.8 Flash($0.75/$3.75)が GPT-6 Astra($10/$50)と0.3ポイント差です。入力単価で約13分の1、出力単価で約13分の1の価格でこの差、というのがGoogleの主張の実体です。この一点だけ見れば「フロンティア級」は誇張ではありません。

一方で Terminal-Bench 4.0 では 19.1% 対 57.9% と3倍の開きがあります。Googleの発表ページに Terminal-Bench 4.0 の数字は出てきません。OpenAIの発表ページに DeepSWE の優位は書かれていません。両社とも、自社が勝つベンチマークを選んで載せています。

では実際に何ができるのか

公式資料を素直に読むと、Gemini 3.8 Flash の位置づけはこうなります。

強い領域

  • 長期的なソフトウェアエンジニアリング(DeepSWE系)— フロンティアモデルと互角、価格は1桁違う
  • 金融・法務といった専門ドメインの分析とレポート作成
  • プロンプトインジェクション耐性(Gray Swan の測定で「飛躍的に向上」)

弱い、または不明な領域

  • ターミナル上の複雑なタスク(Terminal-Bench 4.0 で19.1%)
  • コーディングエージェントの総合指標(61.2 対 Astra 67.0、Opus 5 68.1)

見落とされやすい設計上の注意点

Googleは性能向上の理由を「3.8 Flash がより熱心に処理に取り組む」と説明しています。複雑なタスクでは追加の推論ステップを実行し、ツールを繰り返し呼び出す設計です。

そして公式にこう書かれています。

「特にエフォート レベル(思考の深さの度合い)を高く設定した場合には、パフォーマンスを最大限に引き出すために、より多くのトークンを消費することがあります」

つまり単価が安くても、1タスクあたりの消費トークンが増えれば実コストは上がります。 Googleは対策として「計算効率が最優先の用途ではエフォートレベルを低く設定する」「効率重視なら 3.7 Flash を使い続ける」という2つの逃げ道を明示しています。

価格表の単価だけで乗り換えを判断すると、請求額が想定と合わない可能性があります。

Gemini 3.8 Flash Cyber は誰でも使えるわけではない

同時発表の Flash Cyber は、Fairwind Program を通じて信頼できるパートナーにのみ提供されます。対象は政府機関、重要インフラ事業者、ソフトウェアメンテナーです。一般の開発者が今すぐ触れるものではありません。

公式が挙げた実績:

  • CWE-Bench(自動パッチ適用)で pass@1 47.2%。主要フロンティアモデルの 47.8% とほぼ同等を、大幅に低いコストで達成
  • Chrome セキュリティチームの検証で、より大規模な商用モデルと比べ 2.6倍の正確なパッチを生成
  • Wiz の社内ペネトレーションテストで、他社比 2.3〜5.2倍低いコスト、再現率 +7.5〜9.7%
  • Google Cloud の脆弱性調査チームが、通常なら数か月かかる重大な基盤脆弱性を2時間足らずで発見

Googleは設計方針として「悪用などの攻撃的な機能よりも修正を優先した」と明記しています。同時期の GPT-6 Astra が攻撃側の能力(ExploitBench 100%)で Critical しきい値に達したのとは、方向性が対照的です。

選び方の目安

こういう人推奨
長時間のコーディングエージェントを安く回したい3.8 Flash。DeepSWE でフロンティア級、価格は1桁下
ターミナル操作中心の自動化3.8 Flash は弱い。Terminal-Bench 4.0 で19.1%
コスト予測を固くしたい3.7 Flash を継続。3.8はトークン消費が増えうると公式に明記
セキュリティ業務Flash Cyber は Fairwind Program 経由のみ。一般提供ではない

価格に関する注意

公式ページでは入力$0.75 / 出力$3.75 が「初期提供価格」と脚注付きで表記されています。二次情報として「2027年1月1日から入力$1.50 / 出力$7.50に改定」と報じているメディアがありますが、Googleの公式ブログ本文では改定日を確認できませんでした。 長期のコスト計算をする場合は、公式の料金ページで最新の条件を確認してください。

一次ソース

この記事は、本文末尾に挙げた各社の公式発表・公式ドキュメントを突き合わせて AI(Anthropic Claude)が下書きし、運営者が数値と内容を確認したうえで掲載しています。 数値は掲載時点の公式資料にもとづきます。最新の条件は各社の公式ページをご確認ください。

主な一次情報(公式発表)を開く

スポンサーリンク

📊関連記事