コンピューター使用APIとは何ですか?
コンピューター使用APIとは、AIモデルが人間と同じようにコンピューターを操作できるようにするものです。画面を見て、クリック、タイピング、スクロール、コマンド実行を行い、タスクを完了させます。これにより、独自のAPIを持たないレガシーなデスクトップアプリや社内ポータルなどのソフトウェアを操作することが可能になります(GUIエージェントの必要性)。
コンピューター使用APIには大きく分けて2つの形態があります。 モデルレベルのツール (Anthropic、OpenAI、Googleなど)はアクションを返します。ユーザー自身がマシンをホストし、ループを実行する必要があります。 マネージドエージェントAPI (Sai、Amazon Nova Act、Browser Use Cloudなど)は、マシンとループの実行を代行し、結果のみを返します。
おすすめの選択肢
- フルデスクトップ作業に最適なマネージドAPI: SimularのSai API
- デスクトップ制御に最適なモデルレベルのツール: Anthropic computer use
- コード駆動型の自動化に最適: OpenAI computer use
- ブラウザとAndroidの操作に最適: Gemini コンピュータ使用
- ブラウザ自動化を行うAWSチームに最適: Amazon Nova Act
- 最高のオープンソースブラウザエージェント: Browser Use
- 最高のオープンウェイトGUIモデル: UI-TARS-2
- 最高のオープンソースデスクトップエージェントフレームワーク: Agent S
エンジニアリングリード、プラットフォームチーム、技術系ファウンダーが コンピュータ使用APIを選定する際に客観的かつ実用的な判断材料を提供するため、当社の評価フレームワークでは各プラットフォームを5つの標準化された運用基準で評価しました。
- 環境カバレッジとネイティブデスクトップへの対応範囲: APIはWindows、macOS、Linux上のデスクトップアプリケーション全体を操作できるか、それともブラウザタブや単一のLinuxコンテナ内に限定されるか。レガシーな業務ソフトウェア、社内ポータル、Androidにも対応しているか、あるいは公開ウェブサイトのみか。
- 長期タスクにおけるベンチマーク検証済みの信頼性: OSWorld 1.0のような、実際のコンピュータ作業を対象とした標準化評価において、システムはどのようなパフォーマンスを発揮しますか? OSWorld 1.0、長期的なタスクを扱う OSWorld 2.0、WindowsAgentArena、AndroidWorldなどについて検証しました。どのベンチマークバージョンが使用され、誰がスコアを報告したかを記録し、単発の成功よりも、タスクの完全な完了と繰り返し実行時の安定性を重視して評価しています。
- インフラの所有権と開発者のオーバーヘッド: 誰がマシンをプロビジョニングし、運用するのか?APIは管理されたコンピュータから完了した結果を返すのか、それとも仮想ディスプレイ、スクリーンショットのループ、アクションハンドラー、セッション状態、エラー復旧の仕組みをチームがゼロから構築する必要があるのか?
- 総所有コスト(TCO)と価格の透明性: モデルのトークン単価、時間単位またはタスク単位の課金、自己ホスト型モデルのGPUコスト、公開されているタスクあたりのコストなど、実際の商用コストを分析しました。また、繰り返し実行されるワークフローが時間の経過とともに安くなるのか、それとも実行のたびにフルコストがかかるのかも確認しています。
- 安全ガードレール、ヒューマン・イン・ザ・ループ、ガバナンス: 支払い、アカウント変更、外部へのメッセージ送信といった重要なアクションの前に、人間による承認を求めるプロセスがあるか?プロンプトインジェクション対策、分離された実行環境、データ保持の制御、本番環境に適した監査機能が提供されているか?
Computer use apis comparison table · HTML
Best computer use APIs compared (October 2026)
| API | Type | Who runs the machine | Environments | Status | Starting pricing |
| Sai APIby Simular | Managed agent | Simular cloud, or your own Mac/Windows device | Windows and Linux cloud computers; Mac and Windows devices | Generally available | Free; $50/mo usage; $500/mo unlimited |
| Anthropic computer useClaude | Model-level tool | You | Any desktop you host (reference Docker image) | Production | Per-token API pricing |
| OpenAI computer useResponses API | Model-level tool | You | Browser (Playwright) or desktop (PyAutoGUI) | Available | Per-token API pricing |
| Gemini computer useGoogle | Model-level tool | You | Browser, Android, desktop | Preview | Per-token API pricing |
| Amazon Nova ActAWS | Managed agent | AWS (Bedrock AgentCore) | Browser | GA since Dec 2, 2025 | $4.75 per agent hour |
| Browser UseOpen source + cloud | Library + managed cloud | You, or Browser Use Cloud | Browser | Available (MIT license) | Free library; cloud = model cost +20% plus browser time |
| UI-TARS-2ByteDance | Open-weight model | You (GPU hosting) | Desktop, browser, Android | Open (Apache-2.0) | Free weights; your compute |
| Agent Sby Simular | Open-source framework | You | Desktop (Linux, macOS, Windows) | Open (Apache-2.0) | Free; you pay your model costs |
コンピュータ操作API ベスト8
1. SimularのSai API — フルデスクトップ作業に最適なマネージドAPI
Sai APIは、 Sai API Simularのコンピュータ操作エージェントである「Sai」にタスクを送信し、進捗状況と結果をストリーミングで返します。SaiはSimularのクラウドコンピュータ、または自身のMacやWindowsマシン上で動作し、デスクトップアプリ、ブラウザ、ファイルシステム、ターミナルを横断して操作可能です(Saiの料金に関するFAQ)。
- 仕組み: タスクを
/v1/agents/messageにPOSTし、セッションがアイドル状態になるまで /v1/agents/events をServer-Sent Eventsで追跡します(ドキュメント)。MCPサーバーである @simular-ai/sai-mcpを使用すると、SaiをClaude Code、Codex、Cursorに統合できます。 - アーキテクチャ: 最先端モデルと専門モデルを組み合わせ、UI要素の特定や結果の検証には専門モデルを活用します。Saiは Simulang コードでサブタスクを長期的に計画し、純粋なモデルを使用する場合と比較してモデル呼び出し回数を約1.5倍削減します(Simular)。
- 繰り返し作業のコスト: 解決済みのタスクはコードとしてコンパイルされ再実行されます。Simularの報告によると、反復的なワークフローにおいてトークンを90%以上削減し、コストを最大約200倍低減可能です(Simular)。
- ベンチマーク: OSWorld 2.0で73.0%の部分スコアを達成(Simular調べ、1タスクあたり15.70ドル)。
- 安全性: 機密性の高い操作を行う際は、
data-approval-request イベントを発行します。 POST /approve を介して承認するか、ユーザーを approvalUrlに誘導してください。 - 制限: 1ユーザーあたり1時間60メッセージまで。アップロードファイルは1つあたり25MBまで(Simular)。
- 料金: 共有Windowsクラウドコンピューターを利用できる無料プラン、月額50ドルの従量課金プラン、月額500ドルの無制限プラン(料金詳細)。
- トレードオフ: モデルへの直接アクセスではなくマネージドエージェントを利用するため、低レベルな操作を個別に制御することはできません。
# Base URL per sai.work/api; confirm before publishing
curl -X POST "https://api.sai.simular.ai/v1/agents/message" \
-H "Authorization: Bearer $SAI_API_KEY" \
-H "Content-Type: application/json" \
-d '{"message": "Download the Q3 sales report from the internal portal, total each column in Excel and save it.", "wait": false}'
# Then stream progress and results
curl -N "https://api.sai.simular.ai/v1/agents/events?sessionId=<sessionId>" \
-H "Authorization: Bearer $SAI_API_KEY"
2. Anthropicのコンピュータ使用 — デスクトップ操作に最適なモデルレベルのツール
Anthropicの コンピュータ使用ツール は、Claudeにスクリーンショットの閲覧とマウス・キーボード操作の権限を与えます。現在の computer_toolset_20260801 は、 screenshot、 left_click、 type 、そして zoomを含む17種類のツールで構成された本番環境向けツールセットであり、ベータ版のヘッダーは付いていません。
- 対応モデル: Claude Opus 4.8、5、5.5、Sonnet 5、5.5、Fable 5/5.1、Mythos 5/5.1。
- 対応プラットフォーム: Claude API、Google Cloud Vertex AI、Amazon Bedrock。AWSおよびMicrosoft Foundryはベータ版で提供。
- 構築するもの: サンドボックス環境(Anthropicの参照実装ではDockerと仮想X11ディスプレイを使用)、エージェントループ、およびアクションハンドラ。 リファレンス実装 を利用してすぐに始められます。
- 安全性: プロンプトインジェクション分類器が自動的に実行されます。Anthropicは、低権限のVMの使用、ドメインの許可リスト設定、および重要な操作に対する人間による確認を推奨しています。コンピュータ使用機能はデータ保持ゼロの対象です。
- トレードオフ: 最大限の制御と強力な推論が可能ですが、インフラストラクチャ、セッション状態、リカバリロジックは自己管理となります。
3. OpenAIのコンピュータ使用 — コード主導の自動化に最適
OpenAIの コンピュータ使用API は2つのアプローチをサポートしています。モデルがPlaywrightやPyAutoGUIを操作するコードを記述する方法と、 コンピュータ ツールを通じて構造化されたマウスおよびキーボード操作を返す方法です。OpenAIはコードベースのアプローチにはGPT-6 Astraを推奨しています。
- 環境: ブラウザ(Playwrightサンプル)およびデスクトップ(PyAutoGUIサンプル)。
- 構築するもの: 隔離された環境、APIループ、スクリーンショットのキャプチャ、および安全制御。
- 注: 多くの古いリストでレビューされているコンシューマー向けエージェント「Operator」は、ChatGPTエージェントに統合され、2025年8月31日に終了しました(OpenAI)。
- トレードオフ: コード記述アプローチは反復的なフローには効率的ですが、ランタイムの保守が必要になります。
4. Gemini computer use — ブラウザおよびAndroidに最適
Googleの computer useツール は、0〜999の正規化された座標を使用して、ブラウザ、モバイル(Android)、デスクトップ環境全体で動作します。推奨モデルはGemini 3.8 Flashです。computer useは、 2026年6月のGemini 3.5 Flashで組み込みツールとなりました。
- 安全性: 組み込みポリシーにより、購入、機密データの変更、通信、アカウント作成、法的合意の際にはユーザーの確認が求められます。プロンプトインジェクション検知はオプトイン形式です。
- 構築するもの: クライアントサイドの実行環境。GoogleはDockerベースのリファレンスを提供しています。
- トレードオフ: まだプレビュー版であり、Googleは「エラーやセキュリティ上の脆弱性が含まれる可能性がある」と警告しています。
5. Amazon Nova Act — ブラウザ自動化を行うAWSチームに最適
Amazon Nova Act は、QAテスト、フォーム入力、データ抽出などのブラウザワークフローを自動化するエージェントを構築するためのマネージドサービスです。2025年12月2日に一般提供が開始され、Bedrock AgentCore Runtimeにデプロイされます。
- 料金: アクティブな作業時間1時間あたり4.75ドル。人間を待機している時間は除外されます(クラスメソッド)。
- トレードオフ: ブラウザに特化しており、GA時点では米国東部(バージニア北部)リージョンのみで動作していました。
6. Browser Use — 最適なオープンソースブラウザエージェント
Browser Use は、あらゆるLLMをブラウザに接続するためのMITライセンスのライブラリであり、エージェントやリモートブラウザ向けのホスト型クラウドも提供しています。GitHubのスター数は11万7000、月間ダウンロード数は740万回に達しています。
- ベンチマーク: BU Bench V1において、Claude Fable 5とオープンソースライブラリの組み合わせで80.0%、Browser Use Cloudで78.0%を記録しました(Browser Use)。
- 料金: ライブラリは無料。クラウドエージェントはモデル利用料に20%を上乗せした金額に加え、ブラウザ利用時間に応じた料金(ブラウザ利用料は1時間あたり0.02ドル〜)が発生します。
- トレードオフ: ブラウザ専用であり、デスクトップアプリにはネイティブ対応していません。
7. UI-TARS-2(ByteDance) — 最適なオープンウェイトGUIモデル
UI-TARS は、Apache-2.0ライセンスのGUIエージェントモデル群です。UI-TARS-2(2025年9月)は、OSWorldで47.5%、WindowsAgentArenaで50.6%、AndroidWorldで73.3%、Online-Mind2Webで88.2%のスコアを記録しています(arXiv)。UI-TARS-1.5-7Bモデルは、単一のGPUで動作可能な軽量モデルです。
- 適した用途: オンプレミス環境やオフライン環境でのデプロイ、および研究開発。
- トレードオフ: モデル、実行環境、リカバリロジックのすべてを自前でホストする必要があります。
8. Agent S by Simular — 最適なオープンソース・デスクトップエージェントフレームワーク
Agent S は、人間のようにコンピュータを操作するエージェントのためのSimular製Apache-2.0フレームワークです。インストールは以下のコマンドで行えます。 pip install gui-agents。Linux、macOS、Windowsに対応しており、メインモデル(OpenAI、Anthropic、Geminiなど)とUI-TARSのようなグラウンディングモデルを組み合わせて使用します。
- ベンチマーク: Agent S3は、OSWorld 1.0においてBest-of-N選択を用いた場合に72.6%を記録し、人間のベースラインである72.36%を上回りました。また、100ステップでの単体実行で66%、WindowsAgentArenaで56.6%、AndroidWorldで71.6%を記録しています(Simular)。
- トレードオフ: 研究用フレームワークであるため、管理されたインフラや承認プロセスが必要な場合は、同じ研究成果を基盤としたSai APIをご利用ください。