🔄アップデートまさおAIじっくり解説ch

Claude CodeにEval改善の新機能「build-eval」「hillclimb」が登場

Anthropicのデブチームから、AIエージェントの評価(Eval)を自動化・改善するための新機能が発表されました。本動画では、公式ブログの内容に基づき、新コマンドの使い方や「過剰適合」を防ぐための重要な原則を解説します。

Eval構築と改善の2つの新コマンド

Claude Codeに「/claude-api build-eval」と「/claude-api hillclimb」の2つのコマンドが追加されました。build-evalは、本番ログやコードから評価用の問題集を作成し、採点者を決定してベースラインを測定するまでの工程をガイドします。hillclimbは、その評価結果を元にプロンプトやツールを1つずつ修正し、精度が向上した修正のみを採用するループを回すコマンドです。

過剰適合(Overfitting)を防ぐ3つの対策

Evalのスコアだけが上がって実力が伴わない「過剰適合」を防ぐために、以下の3点が推奨されています。\n・問題を分ける:改善中に見せてよい「train」と、最後まで見せない「test」に分割し、両方のスコアが上がった修正のみを残す。\n・失敗例をそのまま貼らない:特定の失敗だけに効く修正になりやすいため、失敗の記録をプロンプトに直接貼り付けるのは避ける。\n・答えが見えない作りにする:モデルが公開リポジトリなどからEvalの答えを直接取得できないよう、仕組みで防ぐ。

モデル変更とプロンプト改善の効果

公式の検証例では、Opus 4.8からOpus 5.5へモデルを変更するだけでスコアが向上し、さらにbuild-evalとhillclimbでプロンプトを改善することで、最終的に98.9%まで精度が向上した事例が紹介されています。また、Sonnet 5のような安価なモデルでも、適切にプロンプトを改善すれば、上位モデルをそのまま使うより高い精度を低コストで実現できることが示されました。

なぜ重要か

AIエージェントの改善において、単に最新モデルに切り替えるだけでなく、適切に設計されたEval(特にtrain/testの分離)を用いてプロンプトを最適化することで、コストを抑えながら精度を大幅に引き上げることが可能になります。Evalそのものが壊れている(採点ミスや古いAPI記述など)可能性を疑う視点も重要です。

こんな人におすすめ

AIエージェントの開発者や、Claude Codeを活用してアプリの精度を高めたいエンジニア。Evalの正しい作り方と自動改善の手法が学べます。

見どころ

この記事は まさおAIじっくり解説ch が公開した動画をAI(Google Gemini)が視聴して 日本語にまとめ、公開前に運営者が内容を確認したうえで掲載しています。 要約の性質上、細部が元の発言と異なる場合があります。 正確な内容は元の動画をご確認ください。

YouTubeで元の動画を見る

スポンサーリンク

🔄関連記事