DeepSeek V4 Pro 0813登場:オープンウェイトが商用モデルを凌駕する
DeepSeekが最新モデル「V4 Pro 0813」をリリースしました。このモデルは、以前のプレビュー版と同じアーキテクチャを維持しながら、ポストトレーニングの改善により性能を大幅に向上させています。オープンウェイトとして公開されており、MITライセンスの下で誰でも利用・ホスティングが可能です。商用モデルに匹敵する品質を低コストで実現する、AI界の新たな転換点を紹介します。
背景
DeepSeekは以前「V4 Preview」を公開していましたが、今回の「0813」はより完成度の高いプロ仕様のモデルです。AI業界ではクローズドな商用モデルが主流ですが、DeepSeekはモデルの重み(ウェイト)を公開する戦略をとっています。最近、DeepSeek自身のAPI価格は2.5倍から5倍に引き上げられましたが、オープンウェイトであるため、他のプロバイダーが安価に提供を開始しており、価格競争が起きています。また、最新の研究成果を極めて短期間でプロダクトに反映させる開発スピードも特徴です。
この動画の要点
1. 性能と構造理解の向上:ソフトウェアエンジニアリング(DeepSWE)やデータサイエンス(DSBench-Hard)のベンチマークで、軽量なFlash版を大きく上回るスコアを記録しました。特に3D構造の理解力が向上しており、ルービックキューブのシミュレーションではFlash版が失敗した複雑な構造を正確に把握しています。また、Claude Fable 5や6といった強力なモデルの品質に肉薄しています。
2. ポストトレーニングと蒸留:同じアーキテクチャで性能が向上した秘密は、学習後のプロセスにあります。数学、コーディング、エージェント動作に特化した10以上の「スペシャリスト教師モデル」を作成し、それらの能力を1つの学生モデルに吸収させる「蒸留(Distillation)」を行いました。これはMixture of Experts(MoE)とは異なる手法で、モデルチェックポイントを個別に最適化しています。
3. DSparkによる高速化:最新の研究成果である「DSpark(投機的デコード)」を実装しました。これは次のトークンを1つずつ予測するのではなく、複数のトークンを先読みしてドラフトする技術です。わずか6週間前の論文内容を実用化しており、V4 Proでは生成速度が最大78%向上しています。これにより、非常に高速なレスポンスと、リアルタイム性の高いエージェント動作が可能になりました。
なぜ重要か
DeepSeek V4 Proの重要性は、単なる性能向上に留らず「オープンウェイト」の真価を証明した点にあります。API価格が上昇しても、MITライセンスで公開されているため、他社が競って安価なホスティングを提供し、結果としてユーザーは低価格で高性能なAIを利用し続けられます。また、特定のキーワードでモデルが制限されたり、勝手にダウングレードされたりする心配がない「所有できるAI」としての側面も強調されています。最新の研究成果を数週間でプロダクトに反映させるスピード感は、クローズドな開発体制をとる競合他社にとって大きな脅威となるでしょう。
こんな人におすすめ
AI開発者、エンジニア、コスト効率の高いLLMを探しているビジネスリーダー。最新のLLMアーキテクチャや学習手法(蒸留、投機的デコード)に興味がある研究者。
見どころ
この記事は Two Minute Papers が公開した動画をAI(Google Gemini)が視聴して 日本語にまとめ、公開前に運営者が内容を確認したうえで掲載しています。 要約の性質上、細部が元の発言と異なる場合があります。 正確な内容は元の動画をご確認ください。
YouTubeで元の動画を見る