
コンピュータ使用とは、AIエージェントがグラフィカルインターフェースを通じてソフトウェアを操作できるようにする機能です。人間と同じように画面を読み取り、マウスを動かし、クリック、入力、スクロールを行うことでタスクを完了させます。 APIではなくインターフェースを介して動作するため、コンピュータ使用はデスクトップアプリ、社内ポータル、レガシーシステムなど、本来自動化を想定して構築されていないソフトウェアであっても自動化することが可能です。
この用語がAI業界で広く使われるようになったのは、 AnthropicがClaude向けにコンピュータ使用機能を発表した 2024年10月のことです。現在では主要なAIモデル開発企業がそれぞれ独自のバージョンを提供しており、以下のような自動化プラットフォームにも組み込まれています。 Microsoft Copilot Studio および UiPath ScreenPlay 開発に活用したい場合は、当社のガイド「 開発者のためのコンピュータ使用」をご覧ください。また、小規模なビジネスで導入したい場合は、「 小規模チームのためのコンピュータ使用を利用できます。
すべてのコンピュータ使用エージェントは、タスクが完了するまで以下のループを繰り返します。
コンピュータ自体は通常、個人のノートPCではなく、サンドボックス化された仮想マシンやコンテナです。Anthropic、OpenAI、Googleなどのモデルプロバイダーはアクションを返してマシンをユーザーに委ねますが、マネージドプラットフォームはマシンとループの実行を代行します。
OSWorldは、香港大学のXLANG Labが開発したもので、実際のオペレーティングシステム上で369のタスクを実行し、エージェントの能力をテストします。人間による達成率は72.36%です。より新しい OSWorld 2.0 には、人間が完了するまでに中央値で約1.6時間、平均318回のツール呼び出しを要する、長期的なタスクが108個含まれています。
コンピュータ操作ツールは、以下の5つのグループに分類されます。 マネージドエージェント (コンピュータを操作し、完了した成果物を返すもの) モデルレベルのツール (実行すべきアクションを提示するもの) エンタープライズ自動化プラットフォーム (既存のスイートにコンピュータ操作機能を追加するもの) ブラウザ専用エージェントおよびインフラストラクチャ、そして オープンソースのフレームワークおよびモデル。最適な選択肢は、純粋な精度よりも、誰がマシンを運用するのか、デスクトップアプリが必要かブラウザのみで十分か、そしてプロセスのどの部分を自社で管理したいかによって決まります。
各ツールを5つの基準で比較しました:環境の網羅性(デスクトップ、ブラウザ、モバイル)、長期タスクにおけるベンチマークの証拠、インフラストラクチャの所有者、繰り返し実行を含めた総コスト、そして承認や分離といった安全管理機能です。ベンチマークの主張は、その背後にあるベンチマークの信頼性に依存します。

仕組み: Saiは、最先端モデルと専門モデルを組み合わせて運用するコンピュータ操作エージェントです。UI要素を特定するための専用モデルや、操作を実行する前に画面を検証する判定モデルを備えています。長時間のサブタスクを Simulang コードで計画することで、クリックごとにモデル呼び出しのコストが発生するのを防ぎます。また、解決済みの手順をコードにコンパイルして再実行し、 画面の変化に応じて自己修復を行います。ユーザーはSaiアプリを通じて利用でき、開発者はHTTPSやSSE、あるいは @simular-ai/sai-mcp サーバーを介して、 Simular Platform APIを利用できます。
対応範囲: デスクトップアプリ、ブラウザ、ファイルシステム、ターミナル。SimularのWindows/Linuxクラウドコンピュータ、または自身のMacやWindowsマシン上で動作します(詳細は Saiの料金に関するFAQを参照)。長期的なタスクを扱うOSWorld 2.0において、Simularはタスクあたり15.70ドルで73.0%のパーシャルスコアを記録し、Claude Opus 5の70.6%やGPT-5.6 Solの62.6%を上回りました。タスク全体の成功率は28.25%です(Simular)。
ライセンス: Simularのオープンソース技術を基盤としたクローズド製品 Agent S リサーチ機能。モデルに依存せず、独自のAPIキーやオンプレミスモデルも利用可能です。
料金: 無料プラン(共有Windowsクラウドコンピューター利用)、従量課金プラン(月額50ドル)、無制限プラン(月額500ドル)、エンタープライズ向けカスタムプラン。
最適な用途: 実際のデスクトップ環境でタスクを完遂させたいチームや開発者。特に、実行回数が増えるごとにコスト効率が向上する反復作業に適しています。
制限事項: マネージド型エージェントのため、低レベルな操作をすべてスクリプト化する必要はありません。APIはユーザーあたり1時間60メッセージが上限です。信頼性が確立されるまでは、長時間かかるタスクには確認作業が必要です。

仕組み: アプリケーションがスクリーンショットと computer_toolset_20260801 ツールの定義をClaudeに送信すると、Claudeが17種類のアクション(例: left_click、 入力 または ズーム。コードはサンドボックス内で実行され、次のスクリーンショットが返されます。AnthropicはDockerベースの リファレンス実装。
対応範囲: ハーネスが公開するあらゆる環境。Claude API、Vertex AI、Bedrock経由で、Claude Opus 4.8、5、5.5、Sonnet 5、5.5、およびFableとMythosファミリーでサポートされています(Anthropicドキュメント)。
ライセンス: クローズドモデル、オープンなリファレンスハーネス。
価格: トークン単位の標準的なAPI料金。ステップごとに画像が送信されるため、長時間タスクではコストが積み上がります。
最適な用途: 強固な基盤と完全な制御を求める、独自のAIエージェント製品を開発するエンジニア向け。
制限事項: 完成品ではありません。サンドボックス化、リカバリ、認証情報の管理、承認プロセス、監査などは自身で構築する必要があります。

仕組み: The computer use API は、 computer ツールを通じて構造化されたマウスやキーボード操作を返すか、モデルにPlaywrightやPyAutoGUIのコードを書かせるかのいずれかを行います。コードパスにはGPT-6 Astraが推奨されます。アプリ内の ChatGPT Work(2026年7月9日リリース)は、ドキュメント、接続されたアプリ、ブラウザを扱う長時間のタスクに対応します。
対応範囲: API:ユーザーが提供するブラウザまたはデスクトップ環境。Work:ChatGPT内での動作で、リサーチやドキュメント作成に特化。OpenAIの初期のエージェントであるOperatorは、2025年8月31日にサービスを終了しました。
ライセンス: クローズド。
価格: APIはトークン単位。Workは有料のChatGPTプランに含まれます。
最適な用途: コード主導の自動化を好む開発者、およびリサーチ業務にエージェントを活用したいChatGPTユーザー。
制限事項: APIの実行環境はユーザー自身で用意する必要があります。Workはレガシーなデスクトップソフトウェアを操作するようには設計されていません。

仕組み: Geminiは、ブラウザ、モバイル、デスクトップ環境において、0〜999の正規化された座標グリッド上でアクションを実行します。推奨モデルはGemini 3.8 Flashであり、コンピュータ使用機能は以下のモデルで組み込みツールとなりました。 2026年6月のGemini 3.5 Flash。
対応範囲: どのようなクライアント環境を実装する場合でも、GoogleはDockerベースのリファレンスを提供しています(Geminiドキュメント)。
ライセンス: クローズドモデル。
価格: Gemini APIのトークン単位料金。
最適な用途: WebタスクとAndroidの自動化を併用する必要があるチーム。
制限事項: 現在プレビュー版であり、エラーやセキュリティ上の脆弱性が含まれる可能性があるとGoogleは警告しています。組み込みの確認機能は、購入、機密データ、通信、アカウント作成、法的合意を対象としています。
仕組み: Copilot Studioのコンピュータ使用機能 により、ローコードエージェントがWebサイトやデスクトップアプリを操作できるようになります。コンピュータを使用するエージェントは、 2026年5月に一般提供が開始されました 安全な認証情報管理を備えています。開発者にとって、 Foundry コンピュータ使用ツール は、コードが実行するアクションを提案します。
対応範囲: ブラウザおよびデスクトップアプリ。Foundryのツールは computer-use-preview モデルを3つのAzureリージョンで使用します。
ライセンス: クローズド。
価格: Microsoftライセンスに準拠。Foundryは従量課金制。
最適な用途: Microsoft 365、Entra、Azureを標準導入している組織。
制限事項: Foundryツールはプレビュー版でありSLAの対象外です。また、実行前に安全確認の承認が必要です。

仕組み: ScreenPlay は、自然言語による指示をUI自動化に変換します。サードパーティ製またはUiPathのモデルを使用してライブ画面を読み取り、変更に適応します。そのScreen Agentは OSWorld-Verifiedで67.1%を記録し1位を獲得しました 2026年1月、Claude Opus 4.5を搭載。
対応範囲: Windows、Linux、macOSアプリ。UiPath OrchestratorおよびAI Trust Layerによって管理されます。
ライセンス: クローズドソース。SaaSまたはセルフホスト型。
価格: エンタープライズ契約。
最適な用途: すでにUiPath環境を導入済みの企業。
制限事項: エンタープライズRPAチーム向けに構築されているため、小規模チームでの導入には負荷がかかります。

仕組み: 自然言語とPythonでワークフローを定義し、プレイグラウンドでテストした後、Bedrock AgentCore Runtimeにデプロイします。 Nova Act は2025年12月2日に一般提供が開始されました。
対応環境: QAテスト、フォーム入力、データ抽出などのブラウザワークフロー。
ライセンス: クローズドサービス、オープンソースSDK。
料金: アクティブな作業時間1時間あたり4.75ドル( ClassmethodによるGAレビューを参照)。
おすすめの用途: Webワークフローを自動化するAWSネイティブなチーム。
制限事項: ブラウザに特化しており、米国東部リージョンでのみ利用可能。

仕組み: オーケストレーターが目標をサブタスクに分割し、クラウドサンドボックス内で実行される専門のサブエージェントに割り当てます。そのため、デバイスを閉じても作業が継続され、セッションの再現も可能です(Security Boulevard)。
対応環境: 独自のクラウド環境内でのリサーチ、データ抽出、スプレッドシート作成、フォーム入力、およびWebアプリ生成。
ライセンス: クローズド。Metaによる買収発表は2026年4月に中国の規制当局によって阻止されました。Manusは独立して運営されています。
料金: 無料のデイリークレジットあり。Proプランは月額20ドルから、最大で月額200ドル。
おすすめの用途: リサーチ中心のブラウザベースのタスクを委任したい個人。
制限事項: 独自のサンドボックス環境で動作するため、デスクトップアプリや社内システムとは連携しません。

仕組み: MITライセンスのライブラリが任意のLLMをブラウザに接続します。Browser Use Cloudは、ホスト型エージェントとリモートブラウザを追加します。プロジェクトのGitHubスター数は11万7000件を記録しています(Browser Use)。
対応環境: ブラウザのみ。BU Bench V1において、同ライブラリを使用したClaude Fable 5は80.0%、Browser Use Cloudは78.0%のスコアを記録しました。
ライセンス: MIT。
料金: ライブラリは無料。クラウドエージェントはモデル料金の20%増しに加え、ブラウザ利用時間に応じた課金となります。
おすすめの用途: あらゆるモデルでWebエージェントを構築する開発者。
制限事項: デスクトップアプリやOSレベルのタスクには非対応。
仕組み: Browserbaseは、Playwright、Puppeteer、Selenium、およびオープンソースのStagehandフレームワーク向けに、クラウド上でヘッドレスブラウザを実行します。セッション記録や可観測性機能も備えています(Browserbaseの料金)。
対応環境: クラウドブラウザ。エージェントのロジックはユーザー側で用意するか、Stagehandを使用します。
ライセンス: インフラストラクチャはクローズド。Stagehandはオープンソース。
料金: 無料、Developerプラン月額20ドル、Startupプラン月額99ドル、Scaleプランは個別見積もり。
おすすめの用途: 多数のブラウザセッションを並行して実行するチーム。
制限事項: ブラウザのみ対応。エージェントの品質は構築内容に依存します。
仕組み: Skyvernは、CAPTCHAの解決や二要素認証への対応を含むAIによるブラウザワークフローの自動化を実現し、壊れやすいスクレイピングツールの代替を目指しています。GitHubリポジトリのスター数は23.1kに達しています(Skyvernの料金)。
対応環境: ウェブサイトおよびウェブポータル。
ライセンス: オープンソースコアおよびクラウド版。
料金: 無料枠5,000クレジット。Hobbyプラン月額29ドル、Proプラン月額149ドル。EnterpriseプランはSOC 2およびHIPAA準拠のカスタム対応。
おすすめの用途: フォーム入力が多いポータルサイトを自動化する運用チーム。
制限事項: ブラウザのみ対応。
仕組み: Orgoは、デスクトップ、ターミナル、ファイルシステムを備えた永続的なクラウドコンピュータを提供します。REST、SDK、CLI、またはMCPを通じて制御可能です(Orgo)。
対応環境: 全プランでLinuxに対応。ScaleプランではWindows、クローズドベータ版でMacにも対応しています。モデルとエージェントはご自身でご用意ください。
ライセンス: クローズドソース。
料金: Hackerプラン:月額29ドル(PC 1台)、Startupプラン:月額99ドル(PC 4台)、Scaleプラン:月額399ドル(PC 16台)。
おすすめの用途: VMインフラを構築せずにホスト型デスクトップを利用したい開発者向け。
制限事項: インフラストラクチャであり、エージェントではありません。信頼性は構築するスタックに依存します。
仕組み: Cua デスクトップ全体を操作するエージェントのトレーニングと評価を行うための、オープンソースのサンドボックス、SDK、ベンチマークを提供します。
対応範囲: macOS、Linux、Windowsのサンドボックス。
ライセンス: オープンソース。
料金: セルフホストは無料。
最適な用途: ローカルで検証可能なインフラストラクチャを求める研究者や開発者向け。
制限事項: フルスタックの構築と運用はユーザー自身で行う必要があります。
仕組み: Agent S は、メインモデル(OpenAI、Anthropic、Geminiなど)とUI-TARSのようなグラウンディングモデルを組み合わせます。インストールは以下を実行してください。 pip install gui-agentsをご覧ください。
対応範囲: Linux、macOS、Windowsデスクトップ。Agent S3はOSWorld 1.0において、best-of-Nで72.6%を記録し、人間の基準値である72.36%を上回りました。単体では66%です(Simular)。
ライセンス: Apache-2.0。
料金: 無料(モデル利用料は別途発生します)。
最適な用途: 研究およびセルフホスト環境での実験。
制限事項: 管理型インフラではなくフレームワークです。本番環境ではSimular Platform APIをご利用ください。
仕組み: GUI操作用にトレーニングされた視覚言語モデル。 UI-TARS-2 は、OSWorldで47.5%、WindowsAgentArenaで50.6%、AndroidWorldで73.3%のスコアを記録しています。
対応範囲: デスクトップ、ブラウザ、Android、ゲームなど、モデルをホストできるあらゆる環境。
ライセンス: Apache-2.0(GitHub)。
料金: 重み付けは無料、GPUホスティング費用のみ。
最適な用途: オンプレミス環境やエアギャップ環境へのデプロイ。
制限事項: 環境構築、ループ処理、リカバリは自前で行う必要があります。
ご自身のワークフローでコンピュータ操作を試してみませんか? Simular Platform APIキーを無料で取得する または Saiを始めるをご覧ください。