【2026年10月3日】AI・Webニュース|ChatGPTに常駐型AI「dot」、Gemini LiveにGuided Vision

ChatGPTでは、会話が終わったあとも継続して仕事を進める常駐型AIエージェント「dot」の段階提供が始まっています。GoogleはGemini Liveに、カメラ映像を音声で説明する「Guided Vision」を追加しました。
10月1日にはChatGPTに服・アクセサリーの仮想試着と書類スキャンも追加され、GitHub CopilotではMac・Windowsのデスクトップアプリを直接操作する「Computer Use」がPublic Previewになっています。
ChatGPTに常駐型AI「dot」、会話が終わっても仕事を継続
OpenAIは、継続的な仕事を任せられるAIエージェント「dot」を発表しました。
通常のチャットは質問や依頼に対してその場で回答しますが、dotは一度任せた役割や目標を引き継ぎ、会話が終わったあとも作業を続けられます。接続したアプリやファイルを使いながら進捗を管理し、判断が必要になったときはユーザーへ確認します。
dotにはクラウド上の専用コンピューターとブラウザがあり、ユーザーのパソコンがオフになっている間も作業を継続できます。調査、データ分析、資料作成、ソフトウェア開発など、複数の作業を長期的に担当させる使い方が想定されています。
dotは、質問ごとに返事をするだけではなく、任せた仕事を継続して進める「常駐型」のAIエージェントです。
dotは対象アカウントへ段階的に提供中です。利用できるプラン・地域・ワークスペース設定には条件があります。
公式情報: ChatGPT Learn「Meet dots」
Gemini Liveに「Guided Vision」、カメラ映像を音声で案内
Googleは10月1日、Gemini Liveに「Guided Vision」を追加しました。
Gemini Liveでスマートフォンのカメラを共有すると、目の前にあるものをリアルタイムで説明できます。カメラが対象からずれている場合には、「少し右へ」「もう少し下へ」といった音声案内で、見たいものを画面に収めるための補助も行います。
もともとは視覚に障害がある人や弱視の人と共同で開発された機能ですが、小さな文字を読む、暗い場所でメニューを確認する、物を探す、色や模様を確認するといった場面にも利用できます。
Guided Visionは、Gemini Liveが利用できる地域・言語のAndroid 9以降の対応端末で提供されています。
Googleは、Guided Visionには誤りが生じる可能性があり、ナビゲーションや障害物検知、白杖などの移動補助の代わりにはならないと案内しています。
公式情報: Google「Guided Vision in Gemini Live」
ChatGPTで服やアクセサリーを仮想試着、気になる商品は保存可能に
ChatGPTのショッピング機能に、服やアクセサリーを自分の写真へ合成して確認できる仮想試着機能が追加されました。
対応する商品には「Try on」ボタンが表示され、自撮り写真を撮影するか、すでにある写真をアップロードすると、ChatGPT Imagesが試着イメージを生成します。
一度登録した参照写真は次回以降の試着にも利用でき、設定画面から変更・削除できます。商品をFavoritesへ保存したり、ChatGPT Library内でフォルダ分けしたりする機能も追加されています。
仮想試着と商品保存は、ChatGPTのWeb版とモバイル版で利用できます。
生成された試着画像は、実際の商品や着用時の見た目を正確に再現する保証はなく、サイズやフィット感も保証されません。購入前には商品の寸法や詳細、返品条件の確認が必要です。
公式情報: OpenAI「Shopping with ChatGPT Search」
ChatGPTのカメラに書類スキャン、複数ページを1つのPDFへ
ChatGPTのカメラに、紙の書類やノートを連続して撮影できるスキャン機能が追加されました。
複数ページを順番に撮影すると、自動的に1つのPDFへまとめられ、そのままChatGPTの会話へアップロードできます。紙の資料を読み取らせたいときに、ページごとに写真を添付する必要がなくなります。
使うときはChatGPTのカメラを開き、3点メニューから「Scan」を選びます。
スキャン機能はiOSで順次提供中です。Android版の提供時期は、現時点の公式リリースノートでは案内されていません。
公式情報: OpenAI「ChatGPT Release Notes」
GitHub CopilotがMac・Windowsのアプリを操作、Computer UseがPublic Preview
GitHub Copilotに、パソコン上のデスクトップアプリを操作できる「Computer Use」が追加されました。
Copilotが画面の内容を確認しながら、ボタンのクリック、文字の入力や編集、キー操作、スクロール、ドラッグなどを行えます。APIやコマンド操作に対応していない古いソフトや、画面操作しかできないアプリも自動化の対象にできます。
現在はGitHub Copilot CLIとGitHub CopilotアプリのmacOS・Windows版でPublic Previewとして提供されています。
Copilotがアプリを操作する前にはユーザーの承認が必要です。macOSではアクセシビリティと画面収録の権限設定も必要になります。
公式情報: GitHub「GitHub Copilot can now interact with desktop apps with computer use」
10月3日のAI・Webニュースまとめ
- ChatGPTに、会話の外でも継続して仕事を進められる常駐型AIエージェント「dot」が登場
- Gemini Liveに、カメラ映像をリアルタイムで音声説明する「Guided Vision」が追加
- ChatGPTで服・アクセサリーを自分の写真へ合成する仮想試着が可能に
- ChatGPTのiOS版で、複数ページを1つのPDFへまとめる書類スキャンを順次提供
- GitHub CopilotがMac・Windowsのデスクトップアプリを直接操作できるように
dotとGitHub CopilotのComputer Useでは、AIに任せられる作業の範囲がこれまでより広がっています。一方で、接続するアプリや操作権限、承認範囲の確認も重要になります。
Guided Vision、仮想試着、書類スキャンは、カメラや写真を使ったAI機能です。AIがテキストだけでなく、目の前のものや紙の資料、商品選びまで扱う場面が増えています。
ChatGPTのスキャン機能はiOSで順次提供中、dotも対象アカウントへ段階的に展開されています。アカウントにまだ表示されていない場合は、提供状況の違いがあります。

