什么是“计算机使用”?AI 智能体如何操作计算机,以及 2026 年的最佳工具

什么是计算机使用(computer use)?

计算机使用是一项人工智能功能,它允许智能体通过图形界面操作软件:它像人类一样读取屏幕,然后移动鼠标、点击、输入和滚动,从而完成任务。 由于它是通过界面而非 API 进行操作,因此计算机使用可以自动化那些原本无法自动化的软件,包括桌面应用程序、内部门户网站和遗留系统。

这一术语进入主流人工智能词汇是在 Anthropic 为 Claude 引入计算机使用功能 的 2024 年 10 月。如今,每家主流模型实验室都发布了相关版本,而自动化平台如 Microsoft Copilot Studio 和 UiPath ScreenPlay 都将其内置于产品中。如果您想利用该功能进行开发,请阅读我们的 开发者计算机使用指南;如果您想将其应用于精益业务,请阅读 小型团队计算机使用指南。

‍

计算机使用的工作原理:感知、规划、行动循环

每个计算机使用智能体都会运行相同的循环,直到任务完成:

  1. 感知: 截取当前屏幕作为截图,并在可用时获取结构化数据,例如浏览器 DOM 或操作系统的辅助功能树。
  2. 规划: 模型根据所见内容及已发生的情况,决定实现目标的下一步行动。
  3. 操作: 代理程序向计算机发送鼠标或键盘操作、Shell 命令或代码块。
  4. 验证: 它会检查新屏幕以确认操作是否成功,然后循环执行。

计算机本身通常是沙盒化的虚拟机或容器,而非个人的笔记本电脑。Anthropic、OpenAI 和 Google 等模型提供商负责返回操作并将机器留给用户;而托管平台则会为您运行机器并处理整个循环。

代理感知和行动的三种方式

  • 视觉优先: 模型读取原始屏幕截图并返回屏幕坐标。它适用于任何界面,但每一步都需要调用模型,且可能会错过较小的目标。 Gemini 的计算机使用功能 在浏览器、Android 和桌面端使用统一的 0–999 坐标网格。
  • 结构优先: 代理读取 DOM 或辅助功能树,并通过引用定位元素。这种方式在浏览器中快速且精确,例如使用 Browserbase 的 Stagehand,但无法识别画布(Canvas)以及缺乏辅助功能数据的应用程序。
  • 代码优先(或神经符号): 模型先进行规划,然后编写驱动界面的代码,从而使重复性工作能够以脚本形式运行。 OpenAI 的计算机使用 API 支持通过 Playwright 或 PyAutoGUI 进行代码执行模式,而 Simular 的代理通过模型学习一次流程后,即可 将其作为自愈代码进行重放。

‍

计算机使用、RPA 与浏览器自动化对比

DimensionTraditional RPABrowser automation (Playwright, Selenium)AI computer use
How you define the taskRecorded steps and flowchartsCode with CSS or XPath selectorsA goal in plain language
Where it worksDesktop and web, per configured appBrowser onlyBrowser, desktop apps, terminal, files
When the interface changesSelectors break until someone fixes themSelectors break until someone fixes themRe-reads the screen and adapts
Cost per runLow once builtLow once builtModel calls per step, unless solved steps are reused as code

‍

如何衡量计算机使用能力:OSWorld 基准测试

OSWorld由香港大学 XLANG 实验室开发,旨在测试智能体在真实操作系统中执行 369 项实际任务的能力;人类完成这些任务的成功率为 72.36%。较新的 OSWorld 2.0 包含 108 项长周期任务,人类完成这些任务的中位时间约为 1.6 小时,平均需要 318 次工具调用。

SystemOSWorld 2.0 partial scoreCost per taskReported by
Sai (Simular)73.0% (28.25% binary)$15.70Simular
Claude Opus 5 Max Thinking70.6%$23.70Anthropic, via Simular
GPT-5.6 Sol Max62.6%$26.62OpenAI, via Simular
Claude Opus 4.8, max thinking54.8% (20.6% binary)n/aXLANG Lab

‍

‍

2026 年最佳计算机使用工具:15 款产品对比

计算机使用工具可分为五类: 托管智能体 直接操作计算机并交付最终成果, 模型级工具 返回供您执行的操作指令, 企业级自动化平台 将计算机使用功能集成到现有套件中, 仅限浏览器的智能体与基础设施以及 开源框架与模型。选择哪款工具,关键不在于原始准确率,而在于由谁来运行机器、您是需要桌面应用还是仅需浏览器,以及您希望掌控多少流程环节。

How we evaluated

我们如何评估计算机使用工具

我们从五个维度对每款工具进行了对比:环境覆盖范围(桌面端、浏览器、移动端)、长周期任务的基准测试数据、基础设施归属权、包含重复运行在内的总成本,以及审批和隔离等安全控制措施。基准测试的参考价值取决于其背后的测试标准:

BenchmarkWhat it testsEnvironmentWhat a good score meansWatch out for
OSWorld 1.0 / OSWorld-Verified369 short, self-contained computer tasksReal Ubuntu, Windows and macOS appsReliable single-task GUI control; humans score 72.36%Step limits and best-of-N settings vary between reports
OSWorld 2.0108 long-horizon workflows, ~1.6 hours eachControlled Linux desktopHolding state across 300+ tool callsPartial and binary scores differ widely; check which is quoted
WindowsAgentArena / AndroidWorldDesktop and mobile app tasksWindows; Android emulatorGeneralization beyond LinuxMostly reported by model builders themselves
Browser benchmarks (BU Bench, Mind2Web)Web navigation and formsLive or replayed websitesStrong web agentsSays nothing about desktop apps

操作系统级与浏览器级计算机使用

DimensionOS-level agentsBrowser-level agents
Control scopeAny app, file dialog, terminal or windowTabs inside one browser
What the agent seesScreenshots, OS accessibility data, filesScreenshots and the page DOM
StrengthsLegacy desktop software, cross-app workflowsSpeed, cheap parallel sessions, precise DOM targeting
Typical failureLong multi-app tasks drifting off courseAny step outside the browser

Comparison Summary

ToolCategoryScopeLicensingStarting price
Sai + Simular Platform APIManaged agent + APIDesktop, browser, files, terminalClosed; open research (Agent S)Free; $50/mo
Anthropic computer useModel toolAny desktop you hostClosed model, open reference harnessPer token
OpenAI computer useModel tool + ChatGPT WorkBrowser or desktop you hostClosedPer token
Gemini computer useModel tool (preview)Browser, Android, desktopClosedPer token
Microsoft Copilot Studio / FoundryEnterprise platformWeb and desktop appsClosedMicrosoft licensing
UiPath ScreenPlayEnterprise platformWindows, Linux, macOS appsClosedEnterprise contract
Amazon Nova ActManaged agent serviceBrowserClosed$4.75/agent hour
ManusConsumer general agentCloud sandbox with browserClosedFree credits; Pro from $20/mo
Browser UseBrowser agent library + cloudBrowserMITFree OSS; usage-based cloud
Browserbase + StagehandBrowser infrastructureCloud browsersClosed infra; open-source StagehandFree; $20/mo
SkyvernBrowser workflow automationBrowserOpen-source core + cloudFree; $29/mo
OrgoDesktop infrastructureCloud Linux (Windows, Mac beta)Closed$29/mo
CuaOpen-source infrastructuremacOS, Linux, Windows sandboxesOpen sourceFree self-hosted
Agent SOpen-source agent frameworkLinux, macOS, WindowsApache-2.0Free + model costs
UI-TARSOpen-weight modelDesktop, browser, AndroidApache-2.0Free weights + GPU

1. Sai 与 Simular 平台 API (Simular):越用越熟练的计算机使用体验

工作原理: Sai 是一款计算机使用智能体,它通过整合前沿模型与专用模型来协同工作,并配备了专门用于定位 UI 元素的模型,以及在执行每一步操作前对屏幕进行验证的判断机制。它以 Simulang 代码形式规划较长的子任务,无需为每次点击支付模型调用费用,随后将已解决的流程编译为代码,以便在屏幕发生变化时进行重放和 自我修复。用户可以通过 Sai 应用程序使用它;开发者则可通过 HTTPS 和 SSE 发送任务,或通过 @simular-ai/sai-mcp 服务器,经由 Simular 平台 API。

能力边界: 支持桌面应用、浏览器、文件系统和终端,可在 Simular 的 Windows 或 Linux 云计算机上运行,也可在您自己的 Mac 或 Windows 机器上运行,具体请参阅 Sai 定价常见问题解答。在长周期 OSWorld 2.0 测试中,Simular 的部分任务得分达到 73.0%,单次任务成本为 15.70 美元,领先于 Claude Opus 5 的 70.6% 和 GPT-5.6 Sol 的 62.6%;完整任务成功率为 28.25%(Simular)。

许可协议: 基于 Simular 开源项目构建的闭源产品 Agent S 研究;模型无关,支持使用您自己的密钥或本地部署模型。

定价: 免费方案包含共享 Windows 云电脑;按需付费方案 50 美元/月;无限使用方案 500 美元/月;企业版可定制。

适用对象: 希望在真实桌面环境下完成任务的团队和开发者,特别适合那些随着运行次数增加而成本递减的重复性工作。

局限性: 属于托管式智能体,无需编写每个底层操作的脚本;API 默认限制为每用户每小时 60 条消息;在建立信任之前,长时间任务仍需人工审核。

‍

2. Claude 计算机使用功能 (Anthropic):目前应用最广泛的模型级工具

工作原理: 您的应用程序将屏幕截图和 </ computer_toolset_20260801 > 工具定义发送给 Claude,模型会返回 17 种操作指令中的一种,例如 </ left_click, 输入 或 缩放。您的代码会在沙盒中执行并返回下一张截图。Anthropic 提供了一个基于 Docker 的 参考实现。

能力边界: 您的测试框架所暴露的任何环境。支持 Claude Opus 4.8、5 和 5.5,Sonnet 5 和 5.5,以及 Fable 和 Mythos 系列,可通过 Claude API、Vertex AI 和 Bedrock 使用(Anthropic 文档)。

许可方式: 闭源模型,开源参考框架。

定价: 标准的按 Token API 费率;每一步都会发送一张图像,因此长时间的任务会产生累积费用。

适用场景: 正在构建自有智能体产品,且希望获得强大基础能力和完全控制权的工程师。

局限性: 非成品:您需要自行构建沙盒、恢复机制、凭据处理、审批流程和审计功能。

‍

3. OpenAI 计算机使用功能与 ChatGPT Work (OpenAI):两条路径,API 或应用程序

工作原理: The 计算机使用 API 通过 computer 工具返回结构化的鼠标和键盘操作,或者让模型编写 Playwright 或 PyAutoGUI 代码;代码路径推荐使用 GPT-6 Astra。在应用中, ChatGPT Work于 2026 年 7 月 9 日发布,可处理涉及文档、关联应用和浏览器的较长任务。

能力边界: API:您提供的浏览器或桌面环境。Work:在 ChatGPT 内部,侧重于研究和文档。OpenAI 早期的智能体 Operator 已于 2025 年 8 月 31 日停止服务。

许可方式: 封闭。

定价: API 按 token 收费;Work 包含在付费 ChatGPT 方案中。

适用场景: 喜欢代码驱动自动化的开发者;需要智能体协助处理繁重研究工作的 ChatGPT 用户。

局限性: API 需要您自行配置运行环境;Work 不支持操作传统的桌面软件。

‍

4. Gemini 计算机使用(Google):通过单一模型实现浏览器、Android 和桌面端操作

工作原理: Gemini 在浏览器、移动端和桌面环境中基于 0–999 的标准化坐标网格执行操作;推荐使用 Gemini 3.8 Flash 模型,计算机使用功能自 2026 年 6 月推出的 Gemini 3.5 Flash。

能力边界: 无论您实现何种客户端环境;Google 均提供基于 Docker 的参考方案(Gemini 文档)。

许可方式: 闭源模型。

定价: 按 Gemini API Token 费率计费。

适用场景: 需要同时进行 Android 自动化和网页任务的团队。

局限性: 仍处于预览阶段;Google 提醒其可能包含错误和安全漏洞。内置确认机制涵盖购买、敏感数据处理、通信、账户创建及法律协议签署等操作。

‍

5. Microsoft Copilot Studio 和 Foundry (Microsoft):Microsoft 技术栈内的计算机使用

工作原理: Copilot Studio 计算机使用功能 允许低代码代理操作网站和桌面应用程序;具备计算机使用能力的代理于 2026 年 5 月正式发布 具备安全的凭据管理功能。对于开发者而言, Foundry 计算机使用工具 会提出由您的代码执行的操作建议。

能力边界: 浏览器和桌面应用程序;Foundry 的工具使用 computer-use-preview 模型,支持三个 Azure 区域。

许可方式: 封闭。

定价: 遵循 Microsoft 许可协议;Foundry 按使用量计费。

适用场景: 已标准化采用 Microsoft 365、Entra 和 Azure 的组织。

局限性: Foundry 工具目前处于预览阶段,不提供服务等级协议 (SLA),且在执行操作前需要您确认安全检查。

‍

6. UiPath ScreenPlay (UiPath):基于 RPA 平台的代理式 UI 自动化

工作原理: ScreenPlay 将自然语言指令转化为 UI 自动化操作,通过读取实时屏幕并适应变化,支持使用第三方或 UiPath 模型。其屏幕代理 (Screen Agent) 在 OSWorld-Verified 榜单中以 67.1% 的准确率排名第一 于 2026 年 1 月使用 Claude Opus 4.5。

能力边界: Windows、Linux 和 macOS 应用程序,由 UiPath Orchestrator 和 AI 信任层进行管理。

许可方式: 闭源;支持 SaaS 或自托管。

定价: 企业合同。

适用场景: 已拥有 UiPath 资产的企业。

局限性: 专为企业级 RPA 团队打造;小型团队采用门槛较高。

‍

7. Amazon Nova Act (AWS):AWS 上的托管浏览器代理

工作原理: 通过自然语言和 Python 定义工作流,在沙盒中进行测试,然后部署到 Bedrock AgentCore 运行时; Nova Act 于 2025 年 12 月 2 日正式发布。

能力边界: 浏览器工作流,例如质量保证测试、表单填写和数据提取。

许可协议: 闭源服务;开源 SDK。

定价: 每小时活跃代理工作费用为 4.75 美元,详见 Classmethod 的正式发布评估。

适用人群: 需要自动化 Web 工作流的 AWS 原生团队。

局限性: 仅专注于浏览器;目前仅在美国东部地区上线。

‍

8. Manus:云沙盒中的通用代理

工作原理: 编排器将您的目标拆解为多个子任务,分配给在云沙盒中运行的专用子代理,因此即使您关闭设备,工作仍会继续;会话可回放(Security Boulevard)。

能力边界: 在自身的云环境中进行研究、数据提取、电子表格处理、表单填写及 Web 应用生成。

许可协议: 闭源。Meta 宣布的收购案于 2026 年 4 月被中国监管机构否决;Manus 目前独立运营。

定价: 提供每日免费额度;Pro 版每月 20 美元起,最高每月 200 美元。

适用人群: 需要委派繁重研究任务及基于浏览器的操作的个人用户。

局限性: 仅在自身的沙盒环境中运行,无法操作您的桌面应用程序或内部系统。

‍

9. Browser Use:最受欢迎的开源浏览器智能体

工作原理: 一个采用 MIT 许可协议的库,可将任何大语言模型(LLM)连接至浏览器;Browser Use Cloud 则提供托管智能体和远程浏览器服务。该项目在 GitHub 上拥有 11.7 万颗星标(Browser Use)。

能力边界: 仅限浏览器操作。在 BU Bench V1 基准测试中,使用该库的 Claude Fable 5 得分为 80.0%,Browser Use Cloud 得分为 78.0%。

许可协议: MIT。

定价: 库免费;云端智能体按模型价格 +20% 外加浏览器使用时长收费。

适用人群: 使用任意模型构建网页智能体的开发者。

局限性: 不支持桌面应用或操作系统级任务。

‍

10. Browserbase 和 Stagehand (Browserbase):面向智能体的浏览器基础设施

工作原理: Browserbase 为 Playwright、Puppeteer、Selenium 及其开源 Stagehand 框架在云端运行无头浏览器,并提供会话录制和可观测性功能(Browserbase 定价)。

能力边界: 云端浏览器;您需自行提供智能体逻辑或使用 Stagehand。

许可协议: 基础设施闭源;Stagehand 开源。

定价: 免费版;开发者版每月 20 美元;初创版每月 99 美元;规模化版需定制。

适用人群: 需要同时运行大量并行浏览器会话的团队。

局限性: 仅限浏览器;智能体质量取决于您的构建方案。

‍

11. Skyvern:具备视觉能力的浏览器工作流自动化工具

工作原理: Skyvern 利用人工智能实现浏览器工作流自动化,支持验证码识别和双重身份验证,旨在取代脆弱的爬虫程序;其 GitHub 仓库拥有 23.1k 颗星(Skyvern 定价)。

能力边界: 网站和 Web 门户。

许可协议: 开源核心加云服务。

定价: 免费提供 5,000 点额度;Hobby 版每月 29 美元;Pro 版每月 149 美元;企业版提供定制化服务,符合 SOC 2 和 HIPAA 标准。

适用人群: 运营团队自动化处理表单繁多的门户网站。

局限性: 仅限浏览器环境。

‍

12. Orgo:为您的智能体提供云端桌面

工作原理: Orgo 提供带有桌面、终端和文件系统的持久化云端计算机,可通过 REST、SDK、CLI 或 MCP 进行控制(Orgo)。

能力边界: 所有方案均支持 Linux,Scale 方案支持 Windows,Mac 版本处于封闭测试阶段。您需自行提供模型和智能体。

许可协议: 闭源。

定价: Hacker 版每月 29 美元(1 台电脑);Startup 版每月 99 美元(4 台);Scale 版每月 399 美元(16 台)。

适用人群: 希望使用托管桌面但不想自行构建虚拟机基础设施的开发者。

局限性: 仅提供基础设施,而非智能体:可靠性取决于您自身的架构。

‍

13. Cua:开源计算机使用基础设施

工作原理: Cua 提供开源沙箱、SDK 和基准测试,用于训练和评估能够控制完整桌面的智能体。

能力边界: macOS、Linux 和 Windows 沙箱。

许可协议: 开源。

定价: 可免费自托管。

适用场景: 需要本地化、可审查基础设施的研究人员和开发者。

局限性: 您需要自行组装和运行整个技术栈。

‍

14. Agent S (Simular Research):超越人类基准线的开源框架

工作原理: Agent S 将主模型(OpenAI、Anthropic、Gemini 等)与 UI-TARS 等基础模型配对;安装方式: pip install gui-agents。

能力边界: Linux、macOS 和 Windows 桌面。Agent S3 在 OSWorld 1.0 上通过 best-of-N 策略达到 72.6% 的准确率,超过了 72.36% 的人类基准线,独立运行准确率为 66%(Simular)。

许可协议: Apache-2.0。

定价: 免费;您只需支付模型使用成本。

适用场景: 研究与自托管实验。

局限性: 这是一个框架,而非托管基础设施;生产环境请使用 Simular Platform API。

‍

15. UI-TARS (字节跳动):开源权重 GUI 模型

工作原理: 专为 GUI 交互训练的视觉语言模型; UI-TARS-2 在 OSWorld 上的得分为 47.5%,在 WindowsAgentArena 上为 50.6%,在 AndroidWorld 上为 73.3%。

能力边界: 桌面端、浏览器、Android 系统及游戏,支持任何您部署该模型的环境。

许可协议: Apache-2.0 (GitHub)。

定价: 免费权重;仅需支付 GPU 托管费用。

适用场景: 本地部署或离线(气隙)部署。

局限性: 您需要自行构建环境、循环机制和恢复流程。

‍

您应该选择哪种计算机使用工具?

  • 如果您希望在真实桌面上完成任务,且无需自行搭建基础设施: Sai 和 Simular Platform API。
  • 如果您正在构建自己的智能体产品: 在 Orgo 或 Cua 桌面环境上使用 Anthropic、OpenAI 或 Gemini 模型工具。
  • 如果您的工作流仅限于浏览器: Browser Use、Browserbase、Skyvern 或 Nova Act。
  • 如果您已标准化使用 Microsoft 或 UiPath: Copilot Studio 或 ScreenPlay。
  • 如果您需要本地部署或研究级控制: 结合 UI-TARS 的 Agent S。

准备好在自己的工作流中尝试计算机使用功能了吗? 获取免费的 Simular Platform API 密钥 或 从 Sai 开始。

Stop doing repetitive tasks. Let Sai handle them for you.

Sai is your AI computer use agent — it operates your apps, automates your workflows, and gets work done while you focus on what matters.

Try Sai

常见问题