
工作超级智能(SI)代理是一种能够接收目标、操作所需应用程序以达成目标,并交付最终成果的软件。与聊天机器人不同,它不仅限于生成文本,而是能够直接在屏幕上或通过工具执行操作。
“SI”是美国联邦政府在 2026 年 9 月 29 日的行政命令之后对人工智能采用的新术语。关于此次更名带来的影响及未变之处,请参阅 AI 与 SI:超级智能对工作的意义。
精选推荐
我们根据以下四个问题对每款工具进行了评分:

Sai 是一款 智能机器人秘书:它是一个计算机使用智能体,能够管理一组自主计算机并交付已完成的任务。它适用于桌面应用、浏览器和内部门户,包括那些 没有 API的工具。
小型团队可从 Sai 中小企业版开始;大型企业则使用 Sai 企业版。

Anthropic 的 计算机使用工具 让 Claude 能够截取屏幕并控制鼠标和键盘。它是当前 Claude 模型(包括 Opus 和 Sonnet)上的生产级工具集。

Devin 自称为“你团队的自主软件工程师”。它能在自己的浏览器中进行规划、编码、测试,并提交拉取请求(Pull Request)。

OpenAI 的智能体产品线经历过两次调整。Operator 于 2025 年 1 月发布,随后被整合进 ChatGPT 智能体中,其独立站点已于 2025 年 8 月 31 日关闭(OpenAI)。2026 年 7 月 9 日,OpenAI 发布了 Work,这是一款“专为处理更长、更复杂任务而设计的智能体”。

Copilot Studio 是微软的低代码智能体构建工具。能够通过用户界面操作网站和桌面应用程序的计算机使用型智能体已于 2026 年 5 月正式发布。

CrewAI 和 LangGraph 是用于构建自有智能体系统的框架。LangGraph 是一个采用 MIT 许可的底层编排库,通过 LangSmith 进行部署。CrewAI 则将智能体组织为“团队(crews)”和“流程(flows)”,并提供托管的 CrewAI 平台。
1. 长期任务的可靠性,而非演示速度。
微小的错误率会产生累积效应:单步准确率为 98% 时,执行 20 个步骤后的整体成功率仅约为 67% (0.98^20)。请关注长周期基准测试的结果,例如 OSWorld 2.0,人类完成这些任务大约需要 1.6 小时,且测试的是重复运行的可靠性,而非仅凭一次运气(pass^k 上的相似度)。
2. 无需 API 依赖的 GUI 操作能力。
许多商业软件没有 API 或对 API 访问收费。一个真正能投入工作的智能体应能直接操作界面,即 每个应用都具备的那个界面。
3. 隔离、凭据保护与审批机制。
在专用且受管理的办公空间中运行智能体,而非在员工的个人桌面上。Anthropic 的 计算机使用文档 建议使用低权限虚拟机,尽可能让登录凭据远离模型,并对关键操作进行人工确认。