什么是计算机使用 API?
计算机使用 API 让 AI 模型能够像人类一样操作计算机:它通过观察屏幕,执行点击、输入、滚动和运行命令等操作来完成任务。它能够触达那些本身没有 API 的软件,例如传统的桌面应用程序和内部门户网站(GUI 智能体的应用场景)。
计算机使用 API 主要有两种形式。 模型级工具 (如 Anthropic、OpenAI、Google)仅返回操作指令;你需要自行托管机器并运行循环程序。 托管式智能体 API (如 Sai、Amazon Nova Act、Browser Use Cloud)则会为你托管机器并运行循环程序,直接返回最终结果。
精选推荐
- 最适合完整桌面工作的托管式 API: Simular 推出的 Sai API
- 最适合桌面控制的模型级工具: Anthropic 计算机使用功能
- 最适合代码驱动的自动化: OpenAI 计算机使用功能
- 最适合浏览器及 Android 环境: Gemini 计算机使用
- 最适合 AWS 团队的浏览器自动化工具: Amazon Nova Act
- 最佳开源浏览器智能体: Browser Use
- 最佳开源权重 GUI 模型: UI-TARS-2
- 最佳开源桌面智能体框架: Agent S
为了给工程主管、平台团队和技术创始人提供客观、可操作的评估,以帮助他们选择 计算机使用 API,我们的评估框架从五个标准化运营维度对每个平台进行了测评:
- 环境覆盖范围与原生桌面支持能力: 该 API 是能在 Windows、macOS 和 Linux 上运行完整的桌面应用程序,还是仅限于浏览器标签页或单个 Linux 容器?它支持传统的业务软件、内部门户和 Android 系统,还是仅限于公开网站?
- 长周期任务的基准测试可靠性: 该系统在真实计算机操作的标准化评估中表现如何,例如 OSWorld 1.0、长周期任务 OSWorld 2.0、WindowsAgentArena 和 AndroidWorld?我们记录了所使用的基准测试版本及各分数的报告方,并优先考量完整任务的完成度及重复运行的一致性,而非单次偶然的成功。
- 基础设施所有权与开发开销: 谁来配置和运行机器?API 是直接返回托管计算机处理后的结果,还是需要您的团队从零开始构建虚拟显示、截图循环、操作处理程序、会话状态及错误恢复机制?
- 总拥有成本与定价透明度: 我们分析了真实的商业成本:按 Token 计算的模型定价、按小时或按任务计费、自托管模型的托管与 GPU 成本,以及已公布的单任务成本数据。我们还核查了重复工作流是否会随时间推移降低成本,还是每次运行都需支付全额推理费用。
- 安全护栏、人工介入与治理: 在执行支付、账户变更或发送消息等关键操作前,平台是否会暂停以等待人工确认?它是否提供提示词注入防御、隔离的执行环境、数据保留控制以及适用于生产环境的可审计性?
Computer use apis comparison table · HTML
Best computer use APIs compared (October 2026)
| API | Type | Who runs the machine | Environments | Status | Starting pricing |
| Sai APIby Simular | Managed agent | Simular cloud, or your own Mac/Windows device | Windows and Linux cloud computers; Mac and Windows devices | Generally available | Free; $50/mo usage; $500/mo unlimited |
| Anthropic computer useClaude | Model-level tool | You | Any desktop you host (reference Docker image) | Production | Per-token API pricing |
| OpenAI computer useResponses API | Model-level tool | You | Browser (Playwright) or desktop (PyAutoGUI) | Available | Per-token API pricing |
| Gemini computer useGoogle | Model-level tool | You | Browser, Android, desktop | Preview | Per-token API pricing |
| Amazon Nova ActAWS | Managed agent | AWS (Bedrock AgentCore) | Browser | GA since Dec 2, 2025 | $4.75 per agent hour |
| Browser UseOpen source + cloud | Library + managed cloud | You, or Browser Use Cloud | Browser | Available (MIT license) | Free library; cloud = model cost +20% plus browser time |
| UI-TARS-2ByteDance | Open-weight model | You (GPU hosting) | Desktop, browser, Android | Open (Apache-2.0) | Free weights; your compute |
| Agent Sby Simular | Open-source framework | You | Desktop (Linux, macOS, Windows) | Open (Apache-2.0) | Free; you pay your model costs |
8 款最佳计算机操作 API
1. Simular 推出的 Sai API — 最适合完整桌面操作的托管 API
该 Sai API 将任务发送给 Simular 的计算机操作智能体 Sai,并以流式传输方式返回进度和结果。Sai 可在 Simular 云端计算机或您自己的 Mac/Windows 机器上运行,适用于桌面应用、浏览器、文件系统和终端(Sai 定价常见问题解答)。
- 工作原理: 发布任务至
/v1/agents/message,然后通过 /v1/agents/events 监听服务器发送事件 (SSE),直到会话进入空闲状态 (文档)。MCP 服务器 @simular-ai/sai-mcp可将 Sai 集成到 Claude Code、Codex 和 Cursor 中。 - 架构: 结合了前沿模型与专用模型,利用专用模型定位 UI 元素并验证结果。Sai 使用 Simulang 代码规划更长的子任务,相比纯模型方案,模型调用次数减少了约 1.5 倍 (Simular)。
- 重复任务成本: 已解决的任务会被编译为代码并可重复执行;据 Simular 报告,在重复性工作流中,Token 消耗量降低了 90% 以上,成本最高可降低约 200 倍 (Simular)。
- 基准测试: 在 OSWorld 2.0 上获得 73.0% 的部分得分,每项任务成本为 15.70 美元(数据来自 Simular)。
- 安全性: 敏感操作会触发
data-approval-request 事件;请通过 POST /approve 进行批准,或将相关人员引导至 approvalUrl。 - 限制: 每位用户每小时 60 条消息;单个上传文件最大 25 MB(Simular)。
- 定价: 提供包含共享 Windows 云电脑的免费方案;按需付费方案每月 50 美元;无限使用方案每月 500 美元(定价详情)。
- 权衡: 这是托管型智能体,而非原始模型访问权限;您无法控制每一个底层操作。
# Base URL per sai.work/api; confirm before publishing
curl -X POST "https://api.sai.simular.ai/v1/agents/message" \
-H "Authorization: Bearer $SAI_API_KEY" \
-H "Content-Type: application/json" \
-d '{"message": "Download the Q3 sales report from the internal portal, total each column in Excel and save it.", "wait": false}'
# Then stream progress and results
curl -N "https://api.sai.simular.ai/v1/agents/events?sessionId=<sessionId>" \
-H "Authorization: Bearer $SAI_API_KEY"
2. Anthropic 计算机使用功能 — 桌面控制领域最出色的模型级工具
Anthropic 的 计算机使用工具 为 Claude 提供了屏幕截图以及鼠标和键盘控制能力。当前的 computer_toolset_20260801 是一个包含 17 个成员工具的生产级工具集,其中包括 screenshot、 left_click、 type 和 zoom,且不再带有测试版标识。
- 模型: Claude Opus 4.8、5 和 5.5;Sonnet 5 和 5.5;Fable 5/5.1 以及 Mythos 5/5.1。
- 平台: Claude API、Google Cloud Vertex AI 和 Amazon Bedrock;AWS 和 Microsoft Foundry 处于测试阶段。
- 构建内容: 沙盒环境(Anthropic 的参考实现使用带有虚拟 X11 显示器的 Docker)、智能体循环和操作处理程序。A 参考实现 助您快速上手。
- 安全性: 提示词注入分类器会自动运行;Anthropic 建议使用低权限虚拟机、域名白名单,并针对关键操作进行人工确认。计算机使用功能符合零数据留存标准。
- 权衡: 具备极高的控制力和强大的推理能力,但您需要自行负责基础设施、会话状态及恢复逻辑。
3. OpenAI 计算机使用功能 —— 代码驱动自动化的最佳选择
OpenAI 的 计算机使用 API 支持两种方案:模型编写代码来驱动 Playwright 或 PyAutoGUI,或者通过 computer 工具返回结构化的鼠标和键盘操作。OpenAI 建议在代码方案中使用 GPT-6 Astra。
- 环境: 浏览器(Playwright 示例)和桌面(PyAutoGUI 示例)。
- 您需要构建的内容: 隔离环境、API 循环、屏幕截图捕获以及安全控制。
- 注意: Operator(许多旧列表中仍在提及的消费者代理)已整合进 ChatGPT 代理,并于 2025 年 8 月 31 日停止服务(OpenAI)。
- 权衡: 代码编写方法对于可重复流程非常高效,但你需要自行维护运行时环境。
4. Gemini 计算机使用 (computer use) — 适用于浏览器和 Android 的最佳选择
Google 的 计算机使用工具 可在浏览器、移动端(Android)和桌面环境中使用,通过标准化的 0–999 坐标进行操作。推荐使用 Gemini 3.8 Flash 模型;计算机使用功能于 2026 年 6 月随 Gemini 3.5 Flash成为内置工具。
- 安全性: 内置策略要求用户在进行购买、敏感数据更改、通信、账户创建和签署法律协议时进行确认;提示词注入检测功能可选择开启。
- 你需要构建的内容: 客户端执行环境;Google 提供了一个基于 Docker 的参考实现。
- 权衡: 目前仍处于预览阶段,Google 提醒其“可能包含错误和安全漏洞”。
5. Amazon Nova Act — 适用于自动化浏览器的 AWS 团队的最佳选择
Amazon Nova Act 是一项托管服务,用于构建可自动化浏览器工作流(如质量保证测试、表单填写和数据提取)的智能体。该服务于 2025 年 12 月 2 日正式发布,并部署在 Bedrock AgentCore Runtime 上。
- 定价: 每位代理每小时活跃工作时间 4.75 美元;不计等待人工的时间(Classmethod)。
- 权衡: 专注于浏览器;在正式发布(GA)时仅支持美国东部(北弗吉尼亚州)区域。
6. Browser Use — 最好的开源浏览器代理
Browser Use 是一个采用 MIT 许可协议的库,可将任何大语言模型(LLM)连接到浏览器,并为代理和远程浏览器提供托管云服务。该项目在 GitHub 上拥有 11.7 万颗星,每月下载量达 740 万次。
- 基准测试: 在其 BU Bench V1 测试中,使用该开源库的 Claude Fable 5 得分为 80.0%,Browser Use Cloud 得分为 78.0%(Browser Use)。
- 定价: 库本身免费;云代理费用为模型价格 +20% 外加浏览器使用时长费用;浏览器费用每小时 0.02 美元起。
- 权衡: 仅限浏览器;无原生桌面应用程序。
7. 字节跳动的 UI-TARS-2 — 最好的开源权重 GUI 模型
UI-TARS 是一个 Apache-2.0 开源协议的 GUI 智能体模型系列。UI-TARS-2(2025 年 9 月发布)在 OSWorld 上的得分为 47.5%,在 WindowsAgentArena 上为 50.6%,在 AndroidWorld 上为 73.3%,在 Online-Mind2Web 上为 88.2(arXiv)。UI-TARS-1.5-7B 模型体积小巧,单张 GPU 即可运行。
- 适用场景: 本地部署、离线环境部署及科研用途。
- 权衡: 您需要自行托管模型、环境及恢复逻辑。
8. Simular 推出的 Agent S — 最优秀的开源桌面智能体框架
Agent S 是 Simular 开发的 Apache-2.0 框架,旨在让智能体像人类一样操作电脑,可通过 pip install gui-agents进行安装。它支持 Linux、macOS 和 Windows 系统,并将主模型(如 OpenAI、Anthropic、Gemini 等)与 UI-TARS 等定位模型相结合。
- 基准测试: Agent S3 在 OSWorld 1.0 上通过 Best-of-N 选择策略取得了 72.6% 的得分,超过了 72.36% 的人类基准线;在 100 步测试中独立得分为 66%;在 WindowsAgentArena 上为 56.6%,在 AndroidWorld 上为 71.6%(Simular)。
- 权衡: 这是一个研究型框架;如需托管基础设施和审批功能,请使用基于同一研究成果构建的 Sai API。