コンピューター・ユースとは?AIエージェントによるコンピューター操作の仕組みと2026年のベストツール

コンピュータ使用(Computer Use)とは何ですか?

コンピュータ使用とは、AIエージェントがグラフィカルインターフェースを通じてソフトウェアを操作できるようにする機能です。人間と同じように画面を読み取り、マウスを動かし、クリック、入力、スクロールを行うことでタスクを完了させます。 APIではなくインターフェースを介して動作するため、コンピュータ使用はデスクトップアプリ、社内ポータル、レガシーシステムなど、本来自動化を想定して構築されていないソフトウェアであっても自動化することが可能です。

この用語がAI業界で広く使われるようになったのは、 AnthropicがClaude向けにコンピュータ使用機能を発表した 2024年10月のことです。現在では主要なAIモデル開発企業がそれぞれ独自のバージョンを提供しており、以下のような自動化プラットフォームにも組み込まれています。 Microsoft Copilot Studio および UiPath ScreenPlay 開発に活用したい場合は、当社のガイド「 開発者のためのコンピュータ使用」をご覧ください。また、小規模なビジネスで導入したい場合は、「 小規模チームのためのコンピュータ使用を利用できます。

‍

コンピュータ使用の仕組み:「認識・計画・実行」のループ

すべてのコンピュータ使用エージェントは、タスクが完了するまで以下のループを繰り返します。

  1. 認識: 現在の画面をスクリーンショットとしてキャプチャします。利用可能な場合は、ブラウザのDOMやOSのアクセシビリティツリーといった構造化データも取得します。
  2. 計画: モデルが、現在の状況とこれまでの経緯を踏まえ、目標達成に向けた次のステップを決定します。
  3. 実行: エージェントがマウスやキーボードの操作、シェルコマンド、またはコードブロックをコンピュータに送信します。
  4. 検証: 新しい画面を確認して操作が成功したかを判断し、ループを繰り返します。

コンピュータ自体は通常、個人のノートPCではなく、サンドボックス化された仮想マシンやコンテナです。Anthropic、OpenAI、Googleなどのモデルプロバイダーはアクションを返してマシンをユーザーに委ねますが、マネージドプラットフォームはマシンとループの実行を代行します。

エージェントが認識し行動する3つの方法

  • ビジョン優先: モデルがスクリーンショットを読み取り、画面上の座標を返します。あらゆるインターフェースで動作しますが、ステップごとにモデル呼び出しのコストが発生し、小さなターゲットを見逃す可能性があります。 Geminiのコンピュータ使用 ブラウザ、Android、デスクトップ全体で0〜999の正規化された座標グリッドを使用します。
  • 構造優先: エージェントがDOMやアクセシビリティツリーを読み取り、参照によって要素をターゲットにします。これはブラウザ内では高速かつ正確で、例えば BrowserbaseのStagehandなどが該当しますが、キャンバスやアクセシビリティデータのないアプリは認識できません。
  • コード優先(ニューロシンボリック): モデルが計画を立ててからインターフェースを操作するコードを記述するため、繰り返し作業をスクリプトとして実行できます。 OpenAIのコンピュータ使用API PlaywrightやPyAutoGUIを使用したコード実行モードをサポートしており、Simularのエージェントはモデルを使って手順を一度学習した後、 自己修復コードとしてリプレイを利用できます。

‍

コンピュータ操作、RPA、ブラウザ自動化の比較

DimensionTraditional RPABrowser automation (Playwright, Selenium)AI computer use
How you define the taskRecorded steps and flowchartsCode with CSS or XPath selectorsA goal in plain language
Where it worksDesktop and web, per configured appBrowser onlyBrowser, desktop apps, terminal, files
When the interface changesSelectors break until someone fixes themSelectors break until someone fixes themRe-reads the screen and adapts
Cost per runLow once builtLow once builtModel calls per step, unless solved steps are reused as code

‍

コンピュータ操作の測定方法:OSWorldベンチマーク

OSWorldは、香港大学のXLANG Labが開発したもので、実際のオペレーティングシステム上で369のタスクを実行し、エージェントの能力をテストします。人間による達成率は72.36%です。より新しい OSWorld 2.0 には、人間が完了するまでに中央値で約1.6時間、平均318回のツール呼び出しを要する、長期的なタスクが108個含まれています。

SystemOSWorld 2.0 partial scoreCost per taskReported by
Sai (Simular)73.0% (28.25% binary)$15.70Simular
Claude Opus 5 Max Thinking70.6%$23.70Anthropic, via Simular
GPT-5.6 Sol Max62.6%$26.62OpenAI, via Simular
Claude Opus 4.8, max thinking54.8% (20.6% binary)n/aXLANG Lab

‍

‍

2026年版:コンピュータ操作ツール15選の比較

コンピュータ操作ツールは、以下の5つのグループに分類されます。 マネージドエージェント (コンピュータを操作し、完了した成果物を返すもの) モデルレベルのツール (実行すべきアクションを提示するもの) エンタープライズ自動化プラットフォーム (既存のスイートにコンピュータ操作機能を追加するもの) ブラウザ専用エージェントおよびインフラストラクチャ、そして オープンソースのフレームワークおよびモデル。最適な選択肢は、純粋な精度よりも、誰がマシンを運用するのか、デスクトップアプリが必要かブラウザのみで十分か、そしてプロセスのどの部分を自社で管理したいかによって決まります。

How we evaluated

コンピュータ操作ツールの評価方法

各ツールを5つの基準で比較しました:環境の網羅性(デスクトップ、ブラウザ、モバイル)、長期タスクにおけるベンチマークの証拠、インフラストラクチャの所有者、繰り返し実行を含めた総コスト、そして承認や分離といった安全管理機能です。ベンチマークの主張は、その背後にあるベンチマークの信頼性に依存します。

BenchmarkWhat it testsEnvironmentWhat a good score meansWatch out for
OSWorld 1.0 / OSWorld-Verified369 short, self-contained computer tasksReal Ubuntu, Windows and macOS appsReliable single-task GUI control; humans score 72.36%Step limits and best-of-N settings vary between reports
OSWorld 2.0108 long-horizon workflows, ~1.6 hours eachControlled Linux desktopHolding state across 300+ tool callsPartial and binary scores differ widely; check which is quoted
WindowsAgentArena / AndroidWorldDesktop and mobile app tasksWindows; Android emulatorGeneralization beyond LinuxMostly reported by model builders themselves
Browser benchmarks (BU Bench, Mind2Web)Web navigation and formsLive or replayed websitesStrong web agentsSays nothing about desktop apps

OSレベルとブラウザレベルのコンピュータ操作の違い

DimensionOS-level agentsBrowser-level agents
Control scopeAny app, file dialog, terminal or windowTabs inside one browser
What the agent seesScreenshots, OS accessibility data, filesScreenshots and the page DOM
StrengthsLegacy desktop software, cross-app workflowsSpeed, cheap parallel sessions, precise DOM targeting
Typical failureLong multi-app tasks drifting off courseAny step outside the browser

Comparison Summary

ToolCategoryScopeLicensingStarting price
Sai + Simular Platform APIManaged agent + APIDesktop, browser, files, terminalClosed; open research (Agent S)Free; $50/mo
Anthropic computer useModel toolAny desktop you hostClosed model, open reference harnessPer token
OpenAI computer useModel tool + ChatGPT WorkBrowser or desktop you hostClosedPer token
Gemini computer useModel tool (preview)Browser, Android, desktopClosedPer token
Microsoft Copilot Studio / FoundryEnterprise platformWeb and desktop appsClosedMicrosoft licensing
UiPath ScreenPlayEnterprise platformWindows, Linux, macOS appsClosedEnterprise contract
Amazon Nova ActManaged agent serviceBrowserClosed$4.75/agent hour
ManusConsumer general agentCloud sandbox with browserClosedFree credits; Pro from $20/mo
Browser UseBrowser agent library + cloudBrowserMITFree OSS; usage-based cloud
Browserbase + StagehandBrowser infrastructureCloud browsersClosed infra; open-source StagehandFree; $20/mo
SkyvernBrowser workflow automationBrowserOpen-source core + cloudFree; $29/mo
OrgoDesktop infrastructureCloud Linux (Windows, Mac beta)Closed$29/mo
CuaOpen-source infrastructuremacOS, Linux, Windows sandboxesOpen sourceFree self-hosted
Agent SOpen-source agent frameworkLinux, macOS, WindowsApache-2.0Free + model costs
UI-TARSOpen-weight modelDesktop, browser, AndroidApache-2.0Free weights + GPU

1. SaiおよびSimular Platform API(Simular):反復によって改善されるコンピュータ操作

仕組み: Saiは、最先端モデルと専門モデルを組み合わせて運用するコンピュータ操作エージェントです。UI要素を特定するための専用モデルや、操作を実行する前に画面を検証する判定モデルを備えています。長時間のサブタスクを Simulang コードで計画することで、クリックごとにモデル呼び出しのコストが発生するのを防ぎます。また、解決済みの手順をコードにコンパイルして再実行し、 画面の変化に応じて自己修復を行います。ユーザーはSaiアプリを通じて利用でき、開発者はHTTPSやSSE、あるいは @simular-ai/sai-mcp サーバーを介して、 Simular Platform APIを利用できます。

対応範囲: デスクトップアプリ、ブラウザ、ファイルシステム、ターミナル。SimularのWindows/Linuxクラウドコンピュータ、または自身のMacやWindowsマシン上で動作します(詳細は Saiの料金に関するFAQを参照)。長期的なタスクを扱うOSWorld 2.0において、Simularはタスクあたり15.70ドルで73.0%のパーシャルスコアを記録し、Claude Opus 5の70.6%やGPT-5.6 Solの62.6%を上回りました。タスク全体の成功率は28.25%です(Simular)。

ライセンス: Simularのオープンソース技術を基盤としたクローズド製品 Agent S リサーチ機能。モデルに依存せず、独自のAPIキーやオンプレミスモデルも利用可能です。

料金: 無料プラン(共有Windowsクラウドコンピューター利用)、従量課金プラン(月額50ドル)、無制限プラン(月額500ドル)、エンタープライズ向けカスタムプラン。

最適な用途: 実際のデスクトップ環境でタスクを完遂させたいチームや開発者。特に、実行回数が増えるごとにコスト効率が向上する反復作業に適しています。

制限事項: マネージド型エージェントのため、低レベルな操作をすべてスクリプト化する必要はありません。APIはユーザーあたり1時間60メッセージが上限です。信頼性が確立されるまでは、長時間かかるタスクには確認作業が必要です。

‍

2. Claude computer use (Anthropic):最も広く利用されているモデルレベルのツール

仕組み: アプリケーションがスクリーンショットと computer_toolset_20260801 ツールの定義をClaudeに送信すると、Claudeが17種類のアクション(例: left_click、 入力 または ズーム。コードはサンドボックス内で実行され、次のスクリーンショットが返されます。AnthropicはDockerベースの リファレンス実装。

対応範囲: ハーネスが公開するあらゆる環境。Claude API、Vertex AI、Bedrock経由で、Claude Opus 4.8、5、5.5、Sonnet 5、5.5、およびFableとMythosファミリーでサポートされています(Anthropicドキュメント)。

ライセンス: クローズドモデル、オープンなリファレンスハーネス。

価格: トークン単位の標準的なAPI料金。ステップごとに画像が送信されるため、長時間タスクではコストが積み上がります。

最適な用途: 強固な基盤と完全な制御を求める、独自のAIエージェント製品を開発するエンジニア向け。

制限事項: 完成品ではありません。サンドボックス化、リカバリ、認証情報の管理、承認プロセス、監査などは自身で構築する必要があります。

‍

3. OpenAI computer useおよびChatGPT Work(OpenAI):APIまたはアプリの2つの選択肢

仕組み: The computer use API は、 computer ツールを通じて構造化されたマウスやキーボード操作を返すか、モデルにPlaywrightやPyAutoGUIのコードを書かせるかのいずれかを行います。コードパスにはGPT-6 Astraが推奨されます。アプリ内の ChatGPT Work(2026年7月9日リリース)は、ドキュメント、接続されたアプリ、ブラウザを扱う長時間のタスクに対応します。

対応範囲: API:ユーザーが提供するブラウザまたはデスクトップ環境。Work:ChatGPT内での動作で、リサーチやドキュメント作成に特化。OpenAIの初期のエージェントであるOperatorは、2025年8月31日にサービスを終了しました。

ライセンス: クローズド。

価格: APIはトークン単位。Workは有料のChatGPTプランに含まれます。

最適な用途: コード主導の自動化を好む開発者、およびリサーチ業務にエージェントを活用したいChatGPTユーザー。

制限事項: APIの実行環境はユーザー自身で用意する必要があります。Workはレガシーなデスクトップソフトウェアを操作するようには設計されていません。

‍

4. Gemini computer use (Google):単一モデルでブラウザ、Android、デスクトップを操作

仕組み: Geminiは、ブラウザ、モバイル、デスクトップ環境において、0〜999の正規化された座標グリッド上でアクションを実行します。推奨モデルはGemini 3.8 Flashであり、コンピュータ使用機能は以下のモデルで組み込みツールとなりました。 2026年6月のGemini 3.5 Flash。

対応範囲: どのようなクライアント環境を実装する場合でも、GoogleはDockerベースのリファレンスを提供しています(Geminiドキュメント)。

ライセンス: クローズドモデル。

価格: Gemini APIのトークン単位料金。

最適な用途: WebタスクとAndroidの自動化を併用する必要があるチーム。

制限事項: 現在プレビュー版であり、エラーやセキュリティ上の脆弱性が含まれる可能性があるとGoogleは警告しています。組み込みの確認機能は、購入、機密データ、通信、アカウント作成、法的合意を対象としています。

‍

5. Microsoft Copilot StudioおよびFoundry(Microsoft):Microsoftスタック内でのコンピュータ使用

仕組み: Copilot Studioのコンピュータ使用機能 により、ローコードエージェントがWebサイトやデスクトップアプリを操作できるようになります。コンピュータを使用するエージェントは、 2026年5月に一般提供が開始されました 安全な認証情報管理を備えています。開発者にとって、 Foundry コンピュータ使用ツール は、コードが実行するアクションを提案します。

対応範囲: ブラウザおよびデスクトップアプリ。Foundryのツールは computer-use-preview モデルを3つのAzureリージョンで使用します。

ライセンス: クローズド。

価格: Microsoftライセンスに準拠。Foundryは従量課金制。

最適な用途: Microsoft 365、Entra、Azureを標準導入している組織。

制限事項: Foundryツールはプレビュー版でありSLAの対象外です。また、実行前に安全確認の承認が必要です。

‍

6. UiPath ScreenPlay (UiPath): RPAプラットフォーム上のエージェント型UI自動化

仕組み: ScreenPlay は、自然言語による指示をUI自動化に変換します。サードパーティ製またはUiPathのモデルを使用してライブ画面を読み取り、変更に適応します。そのScreen Agentは OSWorld-Verifiedで67.1%を記録し1位を獲得しました 2026年1月、Claude Opus 4.5を搭載。

対応範囲: Windows、Linux、macOSアプリ。UiPath OrchestratorおよびAI Trust Layerによって管理されます。

ライセンス: クローズドソース。SaaSまたはセルフホスト型。

価格: エンタープライズ契約。

最適な用途: すでにUiPath環境を導入済みの企業。

制限事項: エンタープライズRPAチーム向けに構築されているため、小規模チームでの導入には負荷がかかります。

‍

7. Amazon Nova Act (AWS):AWS上のマネージドブラウザエージェント

仕組み: 自然言語とPythonでワークフローを定義し、プレイグラウンドでテストした後、Bedrock AgentCore Runtimeにデプロイします。 Nova Act は2025年12月2日に一般提供が開始されました。

対応環境: QAテスト、フォーム入力、データ抽出などのブラウザワークフロー。

ライセンス: クローズドサービス、オープンソースSDK。

料金: アクティブな作業時間1時間あたり4.75ドル( ClassmethodによるGAレビューを参照)。

おすすめの用途: Webワークフローを自動化するAWSネイティブなチーム。

制限事項: ブラウザに特化しており、米国東部リージョンでのみ利用可能。

‍

8. Manus:クラウドサンドボックス内の汎用エージェント

仕組み: オーケストレーターが目標をサブタスクに分割し、クラウドサンドボックス内で実行される専門のサブエージェントに割り当てます。そのため、デバイスを閉じても作業が継続され、セッションの再現も可能です(Security Boulevard)。

対応環境: 独自のクラウド環境内でのリサーチ、データ抽出、スプレッドシート作成、フォーム入力、およびWebアプリ生成。

ライセンス: クローズド。Metaによる買収発表は2026年4月に中国の規制当局によって阻止されました。Manusは独立して運営されています。

料金: 無料のデイリークレジットあり。Proプランは月額20ドルから、最大で月額200ドル。

おすすめの用途: リサーチ中心のブラウザベースのタスクを委任したい個人。

制限事項: 独自のサンドボックス環境で動作するため、デスクトップアプリや社内システムとは連携しません。

‍

9. Browser Use (Browser Use):最も人気のあるオープンソースのブラウザエージェント

仕組み: MITライセンスのライブラリが任意のLLMをブラウザに接続します。Browser Use Cloudは、ホスト型エージェントとリモートブラウザを追加します。プロジェクトのGitHubスター数は11万7000件を記録しています(Browser Use)。

対応環境: ブラウザのみ。BU Bench V1において、同ライブラリを使用したClaude Fable 5は80.0%、Browser Use Cloudは78.0%のスコアを記録しました。

ライセンス: MIT。

料金: ライブラリは無料。クラウドエージェントはモデル料金の20%増しに加え、ブラウザ利用時間に応じた課金となります。

おすすめの用途: あらゆるモデルでWebエージェントを構築する開発者。

制限事項: デスクトップアプリやOSレベルのタスクには非対応。

‍

10. BrowserbaseおよびStagehand (Browserbase):エージェント向けブラウザインフラストラクチャ

仕組み: Browserbaseは、Playwright、Puppeteer、Selenium、およびオープンソースのStagehandフレームワーク向けに、クラウド上でヘッドレスブラウザを実行します。セッション記録や可観測性機能も備えています(Browserbaseの料金)。

対応環境: クラウドブラウザ。エージェントのロジックはユーザー側で用意するか、Stagehandを使用します。

ライセンス: インフラストラクチャはクローズド。Stagehandはオープンソース。

料金: 無料、Developerプラン月額20ドル、Startupプラン月額99ドル、Scaleプランは個別見積もり。

おすすめの用途: 多数のブラウザセッションを並行して実行するチーム。

制限事項: ブラウザのみ対応。エージェントの品質は構築内容に依存します。

‍

11. Skyvern:ビジョンを活用したブラウザワークフロー自動化

仕組み: Skyvernは、CAPTCHAの解決や二要素認証への対応を含むAIによるブラウザワークフローの自動化を実現し、壊れやすいスクレイピングツールの代替を目指しています。GitHubリポジトリのスター数は23.1kに達しています(Skyvernの料金)。

対応環境: ウェブサイトおよびウェブポータル。

ライセンス: オープンソースコアおよびクラウド版。

料金: 無料枠5,000クレジット。Hobbyプラン月額29ドル、Proプラン月額149ドル。EnterpriseプランはSOC 2およびHIPAA準拠のカスタム対応。

おすすめの用途: フォーム入力が多いポータルサイトを自動化する運用チーム。

制限事項: ブラウザのみ対応。

‍

12. Orgo:エージェント専用のクラウドデスクトップ

仕組み: Orgoは、デスクトップ、ターミナル、ファイルシステムを備えた永続的なクラウドコンピュータを提供します。REST、SDK、CLI、またはMCPを通じて制御可能です(Orgo)。

対応環境: 全プランでLinuxに対応。ScaleプランではWindows、クローズドベータ版でMacにも対応しています。モデルとエージェントはご自身でご用意ください。

ライセンス: クローズドソース。

料金: Hackerプラン:月額29ドル(PC 1台)、Startupプラン:月額99ドル(PC 4台)、Scaleプラン:月額399ドル(PC 16台)。

おすすめの用途: VMインフラを構築せずにホスト型デスクトップを利用したい開発者向け。

制限事項: インフラストラクチャであり、エージェントではありません。信頼性は構築するスタックに依存します。

‍

13. Cua:オープンソースのコンピュータ操作用インフラストラクチャ

仕組み: Cua デスクトップ全体を操作するエージェントのトレーニングと評価を行うための、オープンソースのサンドボックス、SDK、ベンチマークを提供します。

対応範囲: macOS、Linux、Windowsのサンドボックス。

ライセンス: オープンソース。

料金: セルフホストは無料。

最適な用途: ローカルで検証可能なインフラストラクチャを求める研究者や開発者向け。

制限事項: フルスタックの構築と運用はユーザー自身で行う必要があります。

‍

14. Agent S (Simular Research): 人間の基準値を超えたオープンソースフレームワーク

仕組み: Agent S は、メインモデル(OpenAI、Anthropic、Geminiなど)とUI-TARSのようなグラウンディングモデルを組み合わせます。インストールは以下を実行してください。 pip install gui-agentsをご覧ください。

対応範囲: Linux、macOS、Windowsデスクトップ。Agent S3はOSWorld 1.0において、best-of-Nで72.6%を記録し、人間の基準値である72.36%を上回りました。単体では66%です(Simular)。

ライセンス: Apache-2.0。

料金: 無料(モデル利用料は別途発生します)。

最適な用途: 研究およびセルフホスト環境での実験。

制限事項: 管理型インフラではなくフレームワークです。本番環境ではSimular Platform APIをご利用ください。

‍

15. UI-TARS (ByteDance): オープンウェイトのGUIモデル

仕組み: GUI操作用にトレーニングされた視覚言語モデル。 UI-TARS-2 は、OSWorldで47.5%、WindowsAgentArenaで50.6%、AndroidWorldで73.3%のスコアを記録しています。

対応範囲: デスクトップ、ブラウザ、Android、ゲームなど、モデルをホストできるあらゆる環境。

ライセンス: Apache-2.0(GitHub)。

料金: 重み付けは無料、GPUホスティング費用のみ。

最適な用途: オンプレミス環境やエアギャップ環境へのデプロイ。

制限事項: 環境構築、ループ処理、リカバリは自前で行う必要があります。

‍

どのコンピュータ操作ツールを選ぶべきか?

  • インフラを構築せずに、実際のデスクトップでタスクを完了させたい場合: Sai および Simular Platform APIをご覧ください。
  • 独自のAIエージェント製品を開発している場合: Orgo または Cua デスクトップ上で、Anthropic、OpenAI、または Gemini モデルのツールを使用。
  • ワークフローがブラウザのみで完結する場合: Browser Use、Browserbase、Skyvern、または Nova Act。
  • Microsoft または UiPath を標準採用している場合: Copilot Studio または ScreenPlay。
  • オンプレミス環境や研究目的の制御が必要な場合: UI-TARS を搭載した Agent S。

ご自身のワークフローでコンピュータ操作を試してみませんか? Simular Platform APIキーを無料で取得する または Saiを始めるをご覧ください。

Stop doing repetitive tasks. Let Sai handle them for you.

Sai is your AI computer use agent — it operates your apps, automates your workflows, and gets work done while you focus on what matters.

Try Sai

よくある質問