科学論文を再現するAIエージェント「Faraday」の訓練手法
スタートアップ「inherent」が発表した論文「Training AI Scientists to Replicate Research」を解説する動画です。270億パラメータを持つAI科学者エージェント「Faraday」が、既存の機械学習論文の結果をいかに正確に再現できるか、その訓練プロセスと評価手法に焦点を当てています。
背景
科学における再現性は極めて重要ですが、論文の記述だけでは不十分な場合が多く、高度な試行錯誤が必要です。本研究では、1990年から2026年までに公開された100本のML/AI論文を対象とした「Replica」というタスク空間を構築しました。従来の大規模言語モデル(LLM)は、単にコードを書く能力は高いものの、科学的な文脈を理解して実験結果を忠実に再現することには課題がありました。そこで、Qwen 3.6-27Bをベースに、強化学習(GRPO)を用いて、科学的プロセスを遂行できるエージェントの育成が試みられました。
この動画の要点
1. Faradayは「Codex」をツールとして活用する「CAT(Coding Agent as a Tool)」というアプローチを採用しています。これにより、エージェント自身がコードを生成・実行するだけでなく、外部の高度なコーディング能力を借りて実験を効率的に進めることが可能になりました。
2. 訓練にはGRPO(Group Relative Policy Optimization)とLoRAが使用されました。128Kの長いコンテキストウィンドウを活用し、1時間の制限時間内でGPUリソース(H200など)を使いながら、欠落した図表や実験結果を再現するタスクを学習させています。
3. 評価には、Claude 4.7を用いたルーブリックベースの自動判定と、トップ大学の博士課程学生による人間評価が併用されました。Faradayは、Claude 4.8やGPT-5.5といったより大規模なモデルを上回る再現精度を達成しています。
4. Faradayは単に結果をハードコードする(カンニングする)のではなく、論文の主張を裏付けるメカニズムを実装しようとする傾向が強く、より「科学者らしい」振る舞いを見せることが定性的な分析で明らかになりました。
なぜ重要か
本研究の特筆すべき点は、27Bという比較的小規模なモデルが、適切な強化学習とツール利用(CAT)によって、GPT-5.5のような超巨大モデルを特定の専門タスクで凌駕したことです。特に、ルーブリック(評価基準)を細分化し、ターンの進行度に応じて報酬の重みを変える手法は、長期的な推論が必要なタスクにおける強化学習の安定化に寄与しています。また、AIが「カンニング」を避けて科学的誠実さを保つように訓練できる可能性を示した点は、将来のAI研究助手としての実用性を高める重要な一歩と言えます。
こんな人におすすめ
AI研究者、強化学習エンジニア、科学の自動化に興味がある方。小規模モデルを特定の専門領域で強化する手法や、エージェントの評価設計について学びたい方に最適です。
見どころ
この記事は Hugging Face が公開した動画をAI(Google Gemini)が視聴して 日本語にまとめ、公開前に運営者が内容を確認したうえで掲載しています。 要約の性質上、細部が元の発言と異なる場合があります。 正確な内容は元の動画をご確認ください。
YouTubeで元の動画を見る