Computer Use(画面操作)
この記事は約9分で読めます
ざっくり言うと
Computer Use(コンピューター・ユース)とは、AIがパソコンの画面を見て操作する機能です。マウスやキーボードを、人の代わりに動かします。たとえば予約サイトで空きを探す作業も、画面を確かめながらカチカチと進めてくれます。
文章を返すだけだったAIが、ついに画面の操作までするようになりました。それがComputer Useの立ち位置です。いま誰でも使える機能というより、提供のされ方がサービスごとに違う段階です。言葉の意味と現在地を押さえてください。
イメージ
正確には
Anthropicは2024年10月、Claude 3.5 Sonnetの新しいモデルと同時に、Computer Useを発表しました。これはプログラムから呼び出して使うAPI向けの機能で、位置づけはパブリックベータ(試験公開)でした。公式の発表では、Claudeが「画面を見て、カーソルを動かし、ボタンをクリックし、テキストを入力する」ことができると説明されています。
仕組みをざっくり分けると、5つのステップになります。
| ステップ | やっていること |
|---|---|
| 1. 画面を見る | パソコンやブラウザの画面を撮り、その画像をAIに渡す |
| 2. 状況をつかむ | 画像認識(Vision)で、どんな画面か、どこにボタンがあるかを読み取る |
| 3. 次の一手を決める | 目的に近づくために、どこをクリックし、何を入力するかを判断する |
| 4. 操作する | カーソルの位置、クリック、キー入力を、ツール経由で実行する |
| 5. 繰り返す | 操作したあとの画面を撮り直し、目的が済むまで同じことを続ける |
Computer Useの中身は、画像認識とツールの実行(Function Calling)を組み合わせたものです。まったく新しい技術ではなく、すでにある部品をパソコン操作向けに組み直した形と考えると分かりやすいですね。
他社の動き
画面を操作するAIは、Anthropicだけの話ではありません。これまでに発表された例が2つあります。
- Operator
OpenAIが2025年1月に発表した研究プレビュー(研究段階の先行公開)です。専用のブラウザ環境を操作します - Project Mariner
Googleが公開した研究プロジェクトです。Chromeのタブを操作します
いま提供されているものは、こちらです。
- Built-in Browser(内蔵ブラウザ)
ChatGPTのデスクトップアプリの中で開けるブラウザです。ほかの機能から独立して動くので、単体でも使えます。作業機能のChatGPT Workでは、許可した手元のファイルやアプリも扱えます - ChatGPTデスクトップのComputer Use
許可されたアプリやブラウザをクリックしたり入力したりして、ファイルを移動できる機能です。使えるかどうかは、プランや組織の管理者設定しだいです - Gemini Spark
個人向けのGemini Appsから使える、試験的な機能です。Connected Apps、ログイン中のWebサイト、リモートのブラウザやコンピューターを利用できます
開発者向けの動きもあります。2026年7月21日の発表で、GoogleはGemini 3.6 FlashにComputer Useを標準機能として組み込みました。対象は開発者向けのGemini APIと、法人向けのGemini Enterpriseです。一般の個人向けアプリの話ではありません。
Gemini Sparkを使う条件は、2026年8月12日時点では次のとおりです。
- アカウント
18歳以上の個人Googleアカウントで、Keep Activityの有効化が必要 - 対象プラン
Google AI ProまたはGoogle AI Ultraのサブスクリプションが必要 - 対象の地域
Gemini Appsの提供地域が対象。ただし欧州経済領域とナイジェリア、スイス、英国では使えない
以前は、米国の外だとGoogle AI Ultraが必要でした。いまはProでも使えるようになり、日本もその対象です。
会社ごとに名前も提供のしかたも違います。ただ、AIが画面を見て操作するという大きな方向は共通しています。
ここまでの製品は、向いている相手で2つに分かれます。
ChatGPT Work・Gemini Spark
ふだん使いのユーザー向けの製品です。
Gemini APIのComputer Use
動かす場所と安全の確認を、開発する側が自分で用意して組み込む機能です。Gemini Sparkとは、使える条件も動く場所も違います。
RPAとの違い
画面を自動で操作すると聞いて、RPAを思い出した方もいるかもしれません。RPAは、あらかじめ決めた手順どおりに画面を操作させる、業務自動化の仕組みです。2つの違いは、次の表のとおりです。
| 見るところ | RPA | Computer Use |
|---|---|---|
| 画面の読み取り方 | 座標など、前もって決めた目印を使う | 撮った画面の画像を、AIが見て解釈する |
| 画面が変わったとき | レイアウトが変わるとシナリオが壊れやすい | 変わってもある程度その場で判断できる |
| 指示のしかた | 手順を前もって細かく組む | 目的だけを伝えて任せることもできる |
| 向いている仕事 | 同じ作業を大量に、正確に繰り返す | 手順が毎回少し違う作業や、新しいサイトでの軽い操作 |
大まかに言えば、RPAは決まった作業を厳密に繰り返すのが得意で、Computer Useはその場の画面を見て判断するのが得意です。どちらが上ということではなく、向いている仕事が違います。
向いているのは、画面を見ないと次の操作を決められない作業です。そのうえで、失敗しても元に戻せるものを選んでください。社内の検索、テスト用フォームへの入力、公開されている情報の収集などが当てはまります。送金、購入、契約の変更のような操作は、最後のクリックだけでも人が確認する前提にしてください。
注意点
公式が繰り返し呼びかけるリスク
提供のしかたは、ベータ、研究プレビュー、正式な機能とばらばらです。料金の仕組みや利用規約も、各社がそのつど更新します。仕事で本格的に使う前に、公式ドキュメントで制限、対象の地域、対応する環境を確かめてください。
確認のコツは、任せる前に止まる場所を決めておくことです。
- 入力までは任せる。ただし送信ボタンは押させない
- 候補を探すところまで任せる。予約の確定は自分で押す
関連用語
- AIエージェント — 目標を伝えると、自分で手順を進めてくれる仕組みです
- Vision(画像認識) — 画像や画面の中身をAIが読み取る技術です
- Function Calling — 外部の道具をAIに使わせるための仕組みです
- プロンプトインジェクション — 外から紛れこんだ指示に、AIが従ってしまう問題です
やってみよう
よくある質問
- Q. Computer Useとは何ですか?
- A. AIがパソコンの画面を見て、マウスやキーボードを人の代わりに動かす機能です。画面を撮って状況を読み取り、クリックや文字入力を繰り返しながら作業を進めます。
- Q. RPAとはどう違うのですか?
- A. RPAは座標など前もって決めた目印を使うため、画面のレイアウトが変わると壊れやすくなります。Computer Useは撮った画面をAIが見て解釈するので、手順が毎回少し違う作業にも対応できます。
- Q. どんな作業から任せると安全ですか?
- A. 画面を見ないと次の操作を決められない作業のうち、失敗しても元に戻せるものです。社内の検索、テスト用フォームへの入力、公開されている情報の収集などが当てはまります。
- Q. 任せるときに気をつけることは何ですか?
- A. AIが画面を読み違える誤操作と、開いたページに隠された指示に従ってしまうプロンプトインジェクションです。送金や購入のようにあとから戻せない操作は、最後のクリックだけでも人が確認してください。
公開: 更新: ✓ 公式情報と照合:
参考ソース
- Anthropic - Introducing computer use, a new Claude 3.5 Sonnet, and Claude 3.5 Haiku(公式情報)
- Anthropic Docs - Computer use (beta)(公式情報)
- OpenAI - Introducing Operator(公式情報)
- OpenAI Help Center - ChatGPT Work and Codex(公式情報)
- OpenAI Help Center - Using the built-in browser in the ChatGPT desktop app(公式情報)
- OpenAI Help Center - ChatGPT release notes(公式情報)
- Google DeepMind - Project Mariner(公式情報)
- Google Blog - Introducing Gemini 3.6 Flash, 3.5 Flash-Lite, and 3.5 Flash Cyber(公式情報)
- Gemini Apps Help - Get started with Gemini Spark(公式情報)
- What's new for Gemini Spark(公式情報)
- Gemini Apps Help - Connect custom apps to Gemini Spark with MCP(公式情報)
判断クイズ
画面操作をAIに任せるとき、どこで人が止まるか決められますか?
3問です。答えるとその場で解説が出ます。全問終えたら、「回答を記録する」で学習の記録に残せます。
全問に答えると、回答を記録できます。
残るのは「答えたかどうか」だけで、正解数は保存されません。この端末の中だけに残り、別の端末には引き継がれません。
この教科書は無料で全文公開しています。仕事で使えるところまで進みたい方は、実習と資料がそろった生徒プランをどうぞ。
あわせて読みたい
- AI基礎 | 用語集約7分
AIエージェント
目標を伝えると、自分でやることを分けて、ツールを使いながら最後まで進めてくれるのがAIエージェントです。ふつうのチャットAIとの違い、任せられる仕事、権限を渡すときの注意点を、公式資料に沿ってやさしく解説します。内容を見る - AI基礎 | AI事故を防ぐ基本ルール約5分
AIにPC作業を任せる前に知っておくこと
AIはいま、パソコンの中の作業まで引き受けます。ファイルの削除、上書き、うっかり公開。任せる前に決めておきたいことを、プログラミングをしない個人事業主・小さな会社の方へ向けて整理します。内容を見る - Claude | ツール固有の機能約10分
ClaudeのComputer Use(画面操作)って何?
ClaudeのComputer Useは、Claudeが画面を見ながらクリックや文字入力をして、アプリを操作してくれる機能です。Cowork版の有効化手順、開発者向けAPI版との違い、安全に試すコツをまとめました。内容を見る