ChatGPT Workの新機能:デスクトップアプリとブラウザの直接操作
OpenAIは、ChatGPT Workにおいてデスクトップアプリやブラウザを直接操作できる新機能「Computer Use」と「Chrome use」を発表しました。これにより、プラグインが用意されていないツールや、ログイン済みのウェブサイト上での作業をChatGPTに依頼できるようになります。ユーザーは自身のコンピュータを使い続けながら、バックグラウンドでAIにタスクを任せることが可能です。
背景
従来のChatGPTでは、プラグインを通じて外部ツールと連携してきましたが、すべてのツールにプラグインが存在するわけではありません。また、特定のデスクトップアプリや、すでにログインしているウェブサイトでの操作が必要な場合、これまではユーザーが手動で行う必要がありました。この課題を解決するため、ChatGPTデスクトップアプリの「Work」タブ限定で、AIがユーザーと同じように画面を認識し、クリックやタイピングを行う機能が導入されました。これにより、既存のワークフローを崩すことなく、AIによる自動化の範囲が大幅に拡大しています。
この動画の要点
1. 「Computer Use」と「Chrome use」の導入:ChatGPTがデスクトップアプリやブラウザを直接操作できるようになります。Computer Useはアプリ間の移動やクリック、タイピングを行い、Chrome useはブラウザ内のウェブサイトを操作します。これらはChatGPTデスクトップアプリの「Work」タブでのみ利用可能です。
2. バックグラウンド実行とプライバシー:AIはバックグラウンドで動作するため、ユーザーは作業を中断する必要がありません。また、アプリやサイトへのアクセス前には必ず許可を求め、ユーザーは「一度だけ許可」または「設定を保存」を選択できます。Macでは動作を監視したり、必要に応じて操作を停止したりすることも可能です。
3. プラグインとのハイブリッド活用:プラグインがあるツールには直接連携し、ないものにはブラウザ操作で対応するという柔軟な使い分けが可能です。動画では、Workdayでの休暇申請(ブラウザ操作)とGoogleカレンダーの確認(プラグイン)を組み合わせ、最後にユーザーが内容を確認してから実行する流れが示されています。
なぜ重要か
このアップデートの重要な点は、AIが「API連携(プラグイン)」という枠組みを超えて、人間と同じ「UI操作」という手段を手に入れたことです。これにより、開発者がプラグインを用意するのを待つ必要がなくなり、あらゆる既存ソフトウェアがChatGPTの操作対象となります。特に、スナップショット機能(Command-Command)によってAIが画面の文脈を理解できるようになったことは、指示の手間を劇的に減らします。また、最終的な実行(送信や登録)の前に必ず人間がレビューするステップを設けている点は、実務における安全性と信頼性を担保する現実的なアプローチと言えます。
こんな人におすすめ
業務効率化を目指すビジネスパーソンや、ChatGPTを実務のワークフローに深く組み込みたいユーザーに最適です。複数のアプリやウェブサイトをまたぐ定型業務を自動化したい人が、具体的な活用イメージを掴むのに役立ちます。
見どころ
この記事は OpenAI が公開した動画をAI(Google Gemini)が視聴して 日本語にまとめ、公開前に運営者が内容を確認したうえで掲載しています。 要約の性質上、細部が元の発言と異なる場合があります。 正確な内容は元の動画をご確認ください。
YouTubeで元の動画を見る