
计算机使用是一项人工智能功能,它允许智能体通过图形界面操作软件:它像人类一样读取屏幕,然后移动鼠标、点击、输入和滚动,从而完成任务。 由于它是通过界面而非 API 进行操作,因此计算机使用可以自动化那些原本无法自动化的软件,包括桌面应用程序、内部门户网站和遗留系统。
这一术语进入主流人工智能词汇是在 Anthropic 为 Claude 引入计算机使用功能 的 2024 年 10 月。如今,每家主流模型实验室都发布了相关版本,而自动化平台如 Microsoft Copilot Studio 和 UiPath ScreenPlay 都将其内置于产品中。如果您想利用该功能进行开发,请阅读我们的 开发者计算机使用指南;如果您想将其应用于精益业务,请阅读 小型团队计算机使用指南。
每个计算机使用智能体都会运行相同的循环,直到任务完成:
计算机本身通常是沙盒化的虚拟机或容器,而非个人的笔记本电脑。Anthropic、OpenAI 和 Google 等模型提供商负责返回操作并将机器留给用户;而托管平台则会为您运行机器并处理整个循环。
OSWorld由香港大学 XLANG 实验室开发,旨在测试智能体在真实操作系统中执行 369 项实际任务的能力;人类完成这些任务的成功率为 72.36%。较新的 OSWorld 2.0 包含 108 项长周期任务,人类完成这些任务的中位时间约为 1.6 小时,平均需要 318 次工具调用。
计算机使用工具可分为五类: 托管智能体 直接操作计算机并交付最终成果, 模型级工具 返回供您执行的操作指令, 企业级自动化平台 将计算机使用功能集成到现有套件中, 仅限浏览器的智能体与基础设施以及 开源框架与模型。选择哪款工具,关键不在于原始准确率,而在于由谁来运行机器、您是需要桌面应用还是仅需浏览器,以及您希望掌控多少流程环节。
我们从五个维度对每款工具进行了对比:环境覆盖范围(桌面端、浏览器、移动端)、长周期任务的基准测试数据、基础设施归属权、包含重复运行在内的总成本,以及审批和隔离等安全控制措施。基准测试的参考价值取决于其背后的测试标准:

工作原理: Sai 是一款计算机使用智能体,它通过整合前沿模型与专用模型来协同工作,并配备了专门用于定位 UI 元素的模型,以及在执行每一步操作前对屏幕进行验证的判断机制。它以 Simulang 代码形式规划较长的子任务,无需为每次点击支付模型调用费用,随后将已解决的流程编译为代码,以便在屏幕发生变化时进行重放和 自我修复。用户可以通过 Sai 应用程序使用它;开发者则可通过 HTTPS 和 SSE 发送任务,或通过 @simular-ai/sai-mcp 服务器,经由 Simular 平台 API。
能力边界: 支持桌面应用、浏览器、文件系统和终端,可在 Simular 的 Windows 或 Linux 云计算机上运行,也可在您自己的 Mac 或 Windows 机器上运行,具体请参阅 Sai 定价常见问题解答。在长周期 OSWorld 2.0 测试中,Simular 的部分任务得分达到 73.0%,单次任务成本为 15.70 美元,领先于 Claude Opus 5 的 70.6% 和 GPT-5.6 Sol 的 62.6%;完整任务成功率为 28.25%(Simular)。
许可协议: 基于 Simular 开源项目构建的闭源产品 Agent S 研究;模型无关,支持使用您自己的密钥或本地部署模型。
定价: 免费方案包含共享 Windows 云电脑;按需付费方案 50 美元/月;无限使用方案 500 美元/月;企业版可定制。
适用对象: 希望在真实桌面环境下完成任务的团队和开发者,特别适合那些随着运行次数增加而成本递减的重复性工作。
局限性: 属于托管式智能体,无需编写每个底层操作的脚本;API 默认限制为每用户每小时 60 条消息;在建立信任之前,长时间任务仍需人工审核。

工作原理: 您的应用程序将屏幕截图和 </ computer_toolset_20260801 > 工具定义发送给 Claude,模型会返回 17 种操作指令中的一种,例如 </ left_click, 输入 或 缩放。您的代码会在沙盒中执行并返回下一张截图。Anthropic 提供了一个基于 Docker 的 参考实现。
能力边界: 您的测试框架所暴露的任何环境。支持 Claude Opus 4.8、5 和 5.5,Sonnet 5 和 5.5,以及 Fable 和 Mythos 系列,可通过 Claude API、Vertex AI 和 Bedrock 使用(Anthropic 文档)。
许可方式: 闭源模型,开源参考框架。
定价: 标准的按 Token API 费率;每一步都会发送一张图像,因此长时间的任务会产生累积费用。
适用场景: 正在构建自有智能体产品,且希望获得强大基础能力和完全控制权的工程师。
局限性: 非成品:您需要自行构建沙盒、恢复机制、凭据处理、审批流程和审计功能。

工作原理: The 计算机使用 API 通过 computer 工具返回结构化的鼠标和键盘操作,或者让模型编写 Playwright 或 PyAutoGUI 代码;代码路径推荐使用 GPT-6 Astra。在应用中, ChatGPT Work于 2026 年 7 月 9 日发布,可处理涉及文档、关联应用和浏览器的较长任务。
能力边界: API:您提供的浏览器或桌面环境。Work:在 ChatGPT 内部,侧重于研究和文档。OpenAI 早期的智能体 Operator 已于 2025 年 8 月 31 日停止服务。
许可方式: 封闭。
定价: API 按 token 收费;Work 包含在付费 ChatGPT 方案中。
适用场景: 喜欢代码驱动自动化的开发者;需要智能体协助处理繁重研究工作的 ChatGPT 用户。
局限性: API 需要您自行配置运行环境;Work 不支持操作传统的桌面软件。

工作原理: Gemini 在浏览器、移动端和桌面环境中基于 0–999 的标准化坐标网格执行操作;推荐使用 Gemini 3.8 Flash 模型,计算机使用功能自 2026 年 6 月推出的 Gemini 3.5 Flash。
能力边界: 无论您实现何种客户端环境;Google 均提供基于 Docker 的参考方案(Gemini 文档)。
许可方式: 闭源模型。
定价: 按 Gemini API Token 费率计费。
适用场景: 需要同时进行 Android 自动化和网页任务的团队。
局限性: 仍处于预览阶段;Google 提醒其可能包含错误和安全漏洞。内置确认机制涵盖购买、敏感数据处理、通信、账户创建及法律协议签署等操作。
工作原理: Copilot Studio 计算机使用功能 允许低代码代理操作网站和桌面应用程序;具备计算机使用能力的代理于 2026 年 5 月正式发布 具备安全的凭据管理功能。对于开发者而言, Foundry 计算机使用工具 会提出由您的代码执行的操作建议。
能力边界: 浏览器和桌面应用程序;Foundry 的工具使用 computer-use-preview 模型,支持三个 Azure 区域。
许可方式: 封闭。
定价: 遵循 Microsoft 许可协议;Foundry 按使用量计费。
适用场景: 已标准化采用 Microsoft 365、Entra 和 Azure 的组织。
局限性: Foundry 工具目前处于预览阶段,不提供服务等级协议 (SLA),且在执行操作前需要您确认安全检查。

工作原理: ScreenPlay 将自然语言指令转化为 UI 自动化操作,通过读取实时屏幕并适应变化,支持使用第三方或 UiPath 模型。其屏幕代理 (Screen Agent) 在 OSWorld-Verified 榜单中以 67.1% 的准确率排名第一 于 2026 年 1 月使用 Claude Opus 4.5。
能力边界: Windows、Linux 和 macOS 应用程序,由 UiPath Orchestrator 和 AI 信任层进行管理。
许可方式: 闭源;支持 SaaS 或自托管。
定价: 企业合同。
适用场景: 已拥有 UiPath 资产的企业。
局限性: 专为企业级 RPA 团队打造;小型团队采用门槛较高。

工作原理: 通过自然语言和 Python 定义工作流,在沙盒中进行测试,然后部署到 Bedrock AgentCore 运行时; Nova Act 于 2025 年 12 月 2 日正式发布。
能力边界: 浏览器工作流,例如质量保证测试、表单填写和数据提取。
许可协议: 闭源服务;开源 SDK。
定价: 每小时活跃代理工作费用为 4.75 美元,详见 Classmethod 的正式发布评估。
适用人群: 需要自动化 Web 工作流的 AWS 原生团队。
局限性: 仅专注于浏览器;目前仅在美国东部地区上线。

工作原理: 编排器将您的目标拆解为多个子任务,分配给在云沙盒中运行的专用子代理,因此即使您关闭设备,工作仍会继续;会话可回放(Security Boulevard)。
能力边界: 在自身的云环境中进行研究、数据提取、电子表格处理、表单填写及 Web 应用生成。
许可协议: 闭源。Meta 宣布的收购案于 2026 年 4 月被中国监管机构否决;Manus 目前独立运营。
定价: 提供每日免费额度;Pro 版每月 20 美元起,最高每月 200 美元。
适用人群: 需要委派繁重研究任务及基于浏览器的操作的个人用户。
局限性: 仅在自身的沙盒环境中运行,无法操作您的桌面应用程序或内部系统。

工作原理: 一个采用 MIT 许可协议的库,可将任何大语言模型(LLM)连接至浏览器;Browser Use Cloud 则提供托管智能体和远程浏览器服务。该项目在 GitHub 上拥有 11.7 万颗星标(Browser Use)。
能力边界: 仅限浏览器操作。在 BU Bench V1 基准测试中,使用该库的 Claude Fable 5 得分为 80.0%,Browser Use Cloud 得分为 78.0%。
许可协议: MIT。
定价: 库免费;云端智能体按模型价格 +20% 外加浏览器使用时长收费。
适用人群: 使用任意模型构建网页智能体的开发者。
局限性: 不支持桌面应用或操作系统级任务。
工作原理: Browserbase 为 Playwright、Puppeteer、Selenium 及其开源 Stagehand 框架在云端运行无头浏览器,并提供会话录制和可观测性功能(Browserbase 定价)。
能力边界: 云端浏览器;您需自行提供智能体逻辑或使用 Stagehand。
许可协议: 基础设施闭源;Stagehand 开源。
定价: 免费版;开发者版每月 20 美元;初创版每月 99 美元;规模化版需定制。
适用人群: 需要同时运行大量并行浏览器会话的团队。
局限性: 仅限浏览器;智能体质量取决于您的构建方案。
工作原理: Skyvern 利用人工智能实现浏览器工作流自动化,支持验证码识别和双重身份验证,旨在取代脆弱的爬虫程序;其 GitHub 仓库拥有 23.1k 颗星(Skyvern 定价)。
能力边界: 网站和 Web 门户。
许可协议: 开源核心加云服务。
定价: 免费提供 5,000 点额度;Hobby 版每月 29 美元;Pro 版每月 149 美元;企业版提供定制化服务,符合 SOC 2 和 HIPAA 标准。
适用人群: 运营团队自动化处理表单繁多的门户网站。
局限性: 仅限浏览器环境。
工作原理: Orgo 提供带有桌面、终端和文件系统的持久化云端计算机,可通过 REST、SDK、CLI 或 MCP 进行控制(Orgo)。
能力边界: 所有方案均支持 Linux,Scale 方案支持 Windows,Mac 版本处于封闭测试阶段。您需自行提供模型和智能体。
许可协议: 闭源。
定价: Hacker 版每月 29 美元(1 台电脑);Startup 版每月 99 美元(4 台);Scale 版每月 399 美元(16 台)。
适用人群: 希望使用托管桌面但不想自行构建虚拟机基础设施的开发者。
局限性: 仅提供基础设施,而非智能体:可靠性取决于您自身的架构。
工作原理: Cua 提供开源沙箱、SDK 和基准测试,用于训练和评估能够控制完整桌面的智能体。
能力边界: macOS、Linux 和 Windows 沙箱。
许可协议: 开源。
定价: 可免费自托管。
适用场景: 需要本地化、可审查基础设施的研究人员和开发者。
局限性: 您需要自行组装和运行整个技术栈。
工作原理: Agent S 将主模型(OpenAI、Anthropic、Gemini 等)与 UI-TARS 等基础模型配对;安装方式: pip install gui-agents。
能力边界: Linux、macOS 和 Windows 桌面。Agent S3 在 OSWorld 1.0 上通过 best-of-N 策略达到 72.6% 的准确率,超过了 72.36% 的人类基准线,独立运行准确率为 66%(Simular)。
许可协议: Apache-2.0。
定价: 免费;您只需支付模型使用成本。
适用场景: 研究与自托管实验。
局限性: 这是一个框架,而非托管基础设施;生产环境请使用 Simular Platform API。
工作原理: 专为 GUI 交互训练的视觉语言模型; UI-TARS-2 在 OSWorld 上的得分为 47.5%,在 WindowsAgentArena 上为 50.6%,在 AndroidWorld 上为 73.3%。
能力边界: 桌面端、浏览器、Android 系统及游戏,支持任何您部署该模型的环境。
许可协议: Apache-2.0 (GitHub)。
定价: 免费权重;仅需支付 GPU 托管费用。
适用场景: 本地部署或离线(气隙)部署。
局限性: 您需要自行构建环境、循环机制和恢复流程。
准备好在自己的工作流中尝试计算机使用功能了吗? 获取免费的 Simular Platform API 密钥 或 从 Sai 开始。