Tencentの「WorldClaw」:プロンプトから編集可能な3D世界を生成
Tencent Researchが発表した新しいAIモデル「WorldClaw」を紹介します。このツールは、テキストプロンプトを入力するだけで、広大な3Dオープンワールドを丸ごと生成できる画期的な技術です。単なる一枚の画像や動画ではなく、生成された世界を構成する木々や建物といったあらゆる要素が、個別の編集可能なアセットとして出力される点が最大の特徴です。
背景
従来の3D生成技術では、Gaussian SplatsやNeRFといった手法が注目されてきましたが、WorldClawはそれらとは異なるアプローチをとっています。このモデルの基盤にはTencentの「Hunyuan」モデルが採用されており、2D画像から高品質な3Dアセットへの変換を得意としています。動画内では、ChatGPT(GPT Image 2.0)で生成した画像を「Segment Anything」モデルで分解し、それをHunyuanで3D化するという、複数のAI技術を組み合わせたワークフローが示されています。
この動画の要点
1. プロンプトから3D世界を構築: 「雪に覆われた村」や「PUBGのような砂漠の戦場」といった指示から、地形だけでなく建物や車両、街灯などの詳細なオブジェクトを含む環境を一括で生成します。
2. 個別アセットの編集が可能: 生成された世界は一体のデータではなく、木、家、荷車、電柱などの各要素が独立したアセットとして分離されています。これにより、後から特定のオブジェクトを移動したり変更したりすることが可能です。
3. 高度なマップ出力: 3D空間の情報を正確に保持しており、デプスマップ(深度)、ノーマルマップ(法線)、インスタンスマップといった、ゲーム開発やシミュレーションに不可欠な各種マップを個別に出力できます。
なぜ重要か
WorldClawの重要性は、単に3Dモデルを作るだけでなく、それらが組み合わさった「文脈のある環境」を自動生成できる点にあります。特に注目すべきは、ロボットの学習用シミュレーション環境としての活用です。現実世界で起こりうるあらゆるシナリオを仮想空間で無限に生成し、そこでロボットを訓練する「Sim-to-Real」のプロセスを劇的に加速させる可能性があります。また、ゲーム開発においても、プロトタイピングの時間を大幅に短縮する強力なツールとなるでしょう。
こんな人におすすめ
ゲーム開発者、3Dアーティスト、ロボット工学の研究者、生成AIの最新動向を追っている技術者。プロンプトから実用的な3Dアセット群を生成する方法に興味がある方に最適です。
見どころ
この記事は Matt Wolfe が公開した動画をAI(Google Gemini)が視聴して 日本語にまとめ、公開前に運営者が内容を確認したうえで掲載しています。 要約の性質上、細部が元の発言と異なる場合があります。 正確な内容は元の動画をご確認ください。
YouTubeで元の動画を見る