컴퓨터 사용이란 무엇인가? AI 에이전트의 컴퓨터 조작 방식과 2026년 최고의 도구들

컴퓨터 사용(Computer use)이란 무엇인가요?

컴퓨터 사용은 AI 에이전트가 그래픽 인터페이스를 통해 소프트웨어를 조작할 수 있게 하는 기능입니다. 사람이 하는 것처럼 화면을 읽고, 마우스를 움직이고, 클릭하고, 타이핑하고, 스크롤하여 작업을 완료합니다. API가 아닌 인터페이스를 통해 작동하기 때문에, 컴퓨터 사용 기능은 데스크톱 앱, 사내 포털, 레거시 시스템 등 자동화를 위해 설계되지 않은 소프트웨어까지 자동화할 수 있습니다.

이 용어는 Anthropic이 Claude를 위한 컴퓨터 사용 기능을 발표한 2024년 10월에 AI 업계의 주류 용어로 자리 잡았습니다. 오늘날 주요 모델 연구소들은 모두 이 기능을 탑재한 버전을 출시하고 있으며, Microsoft Copilot Studio 및 UiPath ScreenPlay 와 같은 자동화 플랫폼들도 이를 제품에 통합하고 있습니다. 이 기능을 활용해 개발하고 싶다면 개발자를 위한 컴퓨터 사용 가이드를 읽어보세요. 소규모 비즈니스에 적용하고 싶다면 소규모 팀을 위한 컴퓨터 사용 가이드.

‍

컴퓨터 사용의 작동 원리: 인식, 계획, 실행 루프

모든 컴퓨터 사용 에이전트는 작업이 완료될 때까지 동일한 루프를 반복합니다.

  1. 인식(Perceive): 현재 화면을 스크린샷으로 캡처하고, 가능한 경우 브라우저 DOM이나 운영 체제의 접근성 트리와 같은 구조화된 데이터를 수집합니다.
  2. 계획(Plan): 모델이 현재 화면과 지금까지의 진행 상황을 바탕으로 목표를 달성하기 위한 다음 단계를 결정합니다.
  3. 실행(Act): 에이전트가 마우스나 키보드 동작, 셸 명령 또는 코드 블록을 컴퓨터로 전송합니다.
  4. 확인(Verify): 새로운 화면을 확인하여 동작이 제대로 수행되었는지 검증한 후, 다시 루프를 반복합니다.

컴퓨터 자체는 일반적으로 개인의 노트북이 아닌 샌드박스 처리된 가상 머신이나 컨테이너입니다. Anthropic, OpenAI, Google과 같은 모델 제공업체는 동작을 반환하고 머신 제어는 사용자에게 맡기지만, 관리형 플랫폼은 머신과 루프를 대신 실행해 줍니다.

에이전트가 인식하고 행동하는 세 가지 방식

  • 비전 우선(Vision-first): 모델이 원본 스크린샷을 읽고 화면 좌표를 반환합니다. 모든 인터페이스에서 작동하지만, 단계마다 모델 호출 비용이 발생하며 작은 타겟은 놓칠 수 있습니다. Gemini의 컴퓨터 사용 브라우저, Android, 데스크톱 전반에서 0~999의 정규화된 좌표 그리드를 사용합니다.
  • 구조 우선(Structure-first): 에이전트가 DOM이나 접근성 트리를 읽고 참조를 통해 요소를 타겟팅합니다. 이는 다음과 같은 도구에서 볼 수 있듯이 브라우저에서 빠르고 정확하지만, Browserbase의 Stagehand캔버스나 접근성 데이터가 없는 앱은 인식하지 못합니다.
  • 코드 우선(Code-first) 또는 신경 기호(Neuro-symbolic): 모델이 계획을 세운 뒤 인터페이스를 제어하는 코드를 작성하므로, 반복적인 작업을 스크립트로 실행할 수 있습니다. OpenAI의 컴퓨터 사용 API Playwright나 PyAutoGUI를 사용한 코드 실행 모드를 지원하며, Simular의 에이전트는 모델을 통해 절차를 한 번 학습한 후 자가 치유 코드로 재생.

‍

컴퓨터 사용 vs. RPA vs. 브라우저 자동화

DimensionTraditional RPABrowser automation (Playwright, Selenium)AI computer use
How you define the taskRecorded steps and flowchartsCode with CSS or XPath selectorsA goal in plain language
Where it worksDesktop and web, per configured appBrowser onlyBrowser, desktop apps, terminal, files
When the interface changesSelectors break until someone fixes themSelectors break until someone fixes themRe-reads the screen and adapts
Cost per runLow once builtLow once builtModel calls per step, unless solved steps are reused as code

‍

컴퓨터 사용 능력 측정 방법: OSWorld 벤치마크

OSWorld는 홍콩대학교 XLANG Lab에서 개발했으며, 실제 운영 체제에서 369개의 실제 작업을 수행하도록 에이전트를 테스트합니다. 사람이 이 작업들을 완료하는 비율은 72.36%입니다. 더 최신 버전인 OSWorld 2.0 은 108개의 장기 과제를 포함하고 있으며, 사람이 이를 완료하는 데는 중앙값 기준 약 1.6시간이 소요되고 평균 318회의 도구 호출이 발생합니다.

SystemOSWorld 2.0 partial scoreCost per taskReported by
Sai (Simular)73.0% (28.25% binary)$15.70Simular
Claude Opus 5 Max Thinking70.6%$23.70Anthropic, via Simular
GPT-5.6 Sol Max62.6%$26.62OpenAI, via Simular
Claude Opus 4.8, max thinking54.8% (20.6% binary)n/aXLANG Lab

‍

‍

2026년 최고의 컴퓨터 사용 도구: 15가지 옵션 비교

컴퓨터 사용 도구는 다음 다섯 가지 그룹으로 나뉩니다: 관리형 에이전트 (컴퓨터를 직접 실행하고 완료된 결과물을 반환), 모델 수준 도구 (사용자가 실행할 작업을 제안), 엔터프라이즈 자동화 플랫폼 (기존 제품군에 컴퓨터 사용 기능 추가), 브라우저 전용 에이전트 및 인프라, 그리고 오픈 소스 프레임워크 및 모델. 올바른 선택은 단순한 정확도보다는 누가 기기를 운영하는지, 데스크톱 앱이 필요한지 아니면 브라우저만으로 충분한지, 그리고 작업 과정의 어느 정도까지 직접 제어하고 싶은지에 따라 달라집니다.

How we evaluated

컴퓨터 사용 도구 평가 방법

우리는 다섯 가지 기준에 따라 각 도구를 비교했습니다: 환경 커버리지(데스크톱, 브라우저, 모바일), 장기 작업에 대한 벤치마크 증거, 인프라 소유 주체, 반복 실행을 포함한 총비용, 그리고 승인 및 격리와 같은 안전 제어 기능입니다. 벤치마크 결과는 그 기반이 되는 벤치마크만큼만 유효합니다:

BenchmarkWhat it testsEnvironmentWhat a good score meansWatch out for
OSWorld 1.0 / OSWorld-Verified369 short, self-contained computer tasksReal Ubuntu, Windows and macOS appsReliable single-task GUI control; humans score 72.36%Step limits and best-of-N settings vary between reports
OSWorld 2.0108 long-horizon workflows, ~1.6 hours eachControlled Linux desktopHolding state across 300+ tool callsPartial and binary scores differ widely; check which is quoted
WindowsAgentArena / AndroidWorldDesktop and mobile app tasksWindows; Android emulatorGeneralization beyond LinuxMostly reported by model builders themselves
Browser benchmarks (BU Bench, Mind2Web)Web navigation and formsLive or replayed websitesStrong web agentsSays nothing about desktop apps

OS 수준 대 브라우저 수준의 컴퓨터 사용

DimensionOS-level agentsBrowser-level agents
Control scopeAny app, file dialog, terminal or windowTabs inside one browser
What the agent seesScreenshots, OS accessibility data, filesScreenshots and the page DOM
StrengthsLegacy desktop software, cross-app workflowsSpeed, cheap parallel sessions, precise DOM targeting
Typical failureLong multi-app tasks drifting off courseAny step outside the browser

Comparison Summary

ToolCategoryScopeLicensingStarting price
Sai + Simular Platform APIManaged agent + APIDesktop, browser, files, terminalClosed; open research (Agent S)Free; $50/mo
Anthropic computer useModel toolAny desktop you hostClosed model, open reference harnessPer token
OpenAI computer useModel tool + ChatGPT WorkBrowser or desktop you hostClosedPer token
Gemini computer useModel tool (preview)Browser, Android, desktopClosedPer token
Microsoft Copilot Studio / FoundryEnterprise platformWeb and desktop appsClosedMicrosoft licensing
UiPath ScreenPlayEnterprise platformWindows, Linux, macOS appsClosedEnterprise contract
Amazon Nova ActManaged agent serviceBrowserClosed$4.75/agent hour
ManusConsumer general agentCloud sandbox with browserClosedFree credits; Pro from $20/mo
Browser UseBrowser agent library + cloudBrowserMITFree OSS; usage-based cloud
Browserbase + StagehandBrowser infrastructureCloud browsersClosed infra; open-source StagehandFree; $20/mo
SkyvernBrowser workflow automationBrowserOpen-source core + cloudFree; $29/mo
OrgoDesktop infrastructureCloud Linux (Windows, Mac beta)Closed$29/mo
CuaOpen-source infrastructuremacOS, Linux, Windows sandboxesOpen sourceFree self-hosted
Agent SOpen-source agent frameworkLinux, macOS, WindowsApache-2.0Free + model costs
UI-TARSOpen-weight modelDesktop, browser, AndroidApache-2.0Free weights + GPU

1. Sai 및 Simular 플랫폼 API(Simular): 반복을 통해 개선되는 컴퓨터 사용

작동 방식: Sai는 최첨단 모델과 전문 모델을 조합하여 운영하는 컴퓨터 사용 에이전트입니다. UI 요소를 찾는 전용 모델과 단계가 실행되기 전 화면을 검증하는 판단 모델을 갖추고 있습니다. 이 에이전트는 더 긴 하위 작업을 Simulang 코드로 계획하여 클릭당 모델 호출 비용을 지불하는 대신, 해결된 절차를 코드로 컴파일하여 재실행하고 화면이 변경되면 스스로 복구합니다. 사용자는 Sai 앱을 통해 이를 사용하며, 개발자는 HTTPS 및 SSE를 통해, 또는 @simular-ai/sai-mcp 서버를 통해 Simular 플랫폼 API.

기능 범위: 데스크톱 앱, 브라우저, 파일 시스템 및 터미널을 지원하며, Simular의 Windows 또는 Linux 클라우드 컴퓨터나 사용자의 Mac 또는 Windows 기기에서 실행됩니다( Sai 가격 책정 FAQ참조). 장기적 관점의 OSWorld 2.0에서 Simular는 작업당 15.70달러의 비용으로 73.0%의 부분 점수를 기록하여, Claude Opus 5의 70.6%와 GPT-5.6 Sol의 62.6%를 앞섰습니다. 전체 작업 성공률은 28.25%입니다(Simular).

라이선스: Simular의 오픈 소스를 기반으로 구축된 폐쇄형 제품 Agent S 연구용; 자체 키나 온프레미스 모델을 포함한 모델 애그노스틱(model-agnostic) 방식.

가격: 공유 Windows 클라우드 컴퓨터를 사용하는 무료 플랜; 월 50달러 종량제; 월 500달러 무제한; 기업용 맞춤형 플랜.

추천 대상: 실제 데스크톱에서 작업을 완료하고자 하는 팀 및 개발자, 특히 실행할수록 비용이 절감되어야 하는 반복 업무에 적합합니다.

제한 사항: 관리형 에이전트이므로 모든 저수준 작업을 직접 스크립트로 작성할 필요는 없습니다. API는 사용자당 시간당 60개 메시지로 기본 설정되어 있으며, 신뢰가 쌓이기 전까지는 긴 작업에 대한 검토가 필요합니다.

‍

2. Claude 컴퓨터 사용(Anthropic): 가장 널리 사용되는 모델 수준의 도구

작동 방식: 앱이 스크린샷과 computer_toolset_20260801 도구 정의를 Claude에 전송하면, Claude가 left_click, 입력 또는 확대/축소. 코드가 샌드박스 내에서 실행되고 다음 스크린샷을 반환합니다. Anthropic은 Docker 기반의 참조 구현.

기능 범위: 하네스가 노출하는 모든 환경. Claude API, Vertex AI 및 Bedrock을 통해 Claude Opus 4.8, 5 및 5.5, Sonnet 5 및 5.5, 그리고 Fable 및 Mythos 제품군에서 지원됩니다(Anthropic 문서).

라이선스: 폐쇄형 모델, 오픈 소스 참조 하네스.

가격: 표준 토큰당 API 요금 적용; 모든 단계마다 이미지가 전송되므로 작업이 길어질수록 비용이 누적됩니다.

추천 대상: 강력한 기반과 완전한 제어권을 원하는 자체 에이전트 제품을 구축 중인 엔지니어.

제한 사항: 완성된 제품이 아닙니다. 샌드박싱, 복구, 자격 증명 처리, 승인 및 감사 기능을 직접 구축해야 합니다.

‍

3. OpenAI 컴퓨터 사용 및 ChatGPT Work (OpenAI): API 또는 앱, 두 가지 경로

작동 방식: The computer use API 는 computer 도구를 통해 구조화된 마우스 및 키보드 동작을 반환하거나, 모델이 Playwright 또는 PyAutoGUI 코드를 작성하도록 합니다. 코드 경로에는 GPT-6 Astra 사용을 권장합니다. 앱 내에서 ChatGPT Work는 2026년 7월 9일에 출시되었으며, 문서, 연결된 앱, 브라우저를 활용한 장기 작업을 처리합니다.

기능 범위: API: 사용자가 제공하는 브라우저 또는 데스크톱 환경. Work: ChatGPT 내부에서 연구 및 문서 작업에 최적화. OpenAI의 초기 에이전트였던 Operator는 2025년 8월 31일에 서비스가 종료되었습니다.

라이선스: 비공개.

가격: API는 토큰당 과금, Work는 유료 ChatGPT 플랜에 포함.

추천 대상: 코드 기반 자동화를 선호하는 개발자, 연구 중심 업무를 위한 에이전트가 필요한 ChatGPT 사용자.

제한 사항: API는 런타임 환경을 사용자가 직접 구축해야 하며, Work는 레거시 데스크톱 소프트웨어 운영을 위해 설계되지 않았습니다.

‍

4. Gemini computer use (Google): 단일 모델로 브라우저, Android, 데스크톱 제어

작동 방식: Gemini는 브라우저, 모바일 및 데스크톱 환경을 위해 0~999로 정규화된 좌표 그리드에서 작업을 수행합니다. 권장 모델은 Gemini 3.8 Flash이며, 컴퓨터 사용 기능은 다음 시점부터 내장 도구로 제공되었습니다. 2026년 6월 Gemini 3.5 Flash.

기능 범위: 어떤 클라이언트 환경을 구현하든 상관없습니다. Google은 Docker 기반 참조를 제공합니다(Gemini 문서).

라이선스: 폐쇄형 모델.

가격: 토큰당 Gemini API 요금 적용.

추천 대상: 웹 작업과 함께 Android 자동화가 필요한 팀.

제한 사항: 현재 미리 보기 단계입니다. Google은 오류 및 보안 취약점이 포함될 수 있다고 경고합니다. 내장된 확인 절차는 구매, 민감한 데이터 처리, 통신, 계정 생성 및 법적 계약에 적용됩니다.

‍

5. Microsoft Copilot Studio 및 Foundry (Microsoft): Microsoft 스택 내 컴퓨터 사용

작동 방식: Copilot Studio 컴퓨터 사용 기능은 로우코드 에이전트가 웹사이트와 데스크톱 앱을 조작할 수 있게 해줍니다. 컴퓨터 사용 에이전트는 다음 시점에 정식 출시되었습니다. 2026년 5월 정식 출시 안전한 자격 증명 관리를 제공합니다. 개발자를 위한 Foundry 컴퓨터 사용 도구 는 코드가 실행할 작업을 제안합니다.

기능 범위: 브라우저 및 데스크톱 앱; Foundry 도구는 computer-use-preview 모델을 3개의 Azure 리전에서 사용합니다.

라이선스: 비공개.

가격: Microsoft 라이선스 적용; Foundry는 사용량 기준 과금.

추천 대상: Microsoft 365, Entra 및 Azure를 표준으로 사용하는 조직.

제한 사항: Foundry 도구는 현재 미리 보기 단계로 SLA가 제공되지 않으며, 작업 수행 전 안전 점검 사항을 확인해야 합니다.

‍

6. UiPath ScreenPlay (UiPath): RPA 플랫폼 기반의 에이전트형 UI 자동화

작동 방식: ScreenPlay 는 자연어 지침을 실시간 화면을 읽고 변화에 적응하는 UI 자동화로 변환하며, 타사 또는 UiPath 모델을 사용합니다. 이 도구의 Screen Agent는 OSWorld-Verified에서 67.1%로 1위를 차지했습니다. 2026년 1월 Claude Opus 4.5 기준.

기능 범위: UiPath Orchestrator 및 AI Trust Layer로 제어되는 Windows, Linux 및 macOS 앱.

라이선스: 폐쇄형, SaaS 또는 자체 호스팅.

가격: 기업용 계약.

추천 대상: 기존 UiPath 환경을 보유한 기업.

제한 사항: 기업용 RPA 팀을 위해 구축되었으며, 소규모 팀이 도입하기에는 다소 무거움.

‍

7. Amazon Nova Act (AWS): AWS 기반 관리형 브라우저 에이전트

작동 방식: 자연어와 Python으로 워크플로우를 정의하고, 플레이그라운드에서 테스트한 뒤 Bedrock AgentCore 런타임에 배포하세요. Nova Act 는 2025년 12월 2일에 정식 출시되었습니다.

기능 범위: QA 테스트, 양식 작성, 데이터 추출과 같은 브라우저 워크플로우.

라이선스: 폐쇄형 서비스, 오픈소스 SDK.

가격: 활성 작업 시간당 에이전트당 4.75달러 ( Classmethod의 정식 출시 리뷰.

추천 대상: 웹 워크플로우를 자동화하는 AWS 네이티브 팀.

제한 사항: 브라우저 중심, 미국 동부 리전에서만 출시.

‍

8. Manus: 클라우드 샌드박스 기반의 범용 에이전트

작동 방식: 오케스트레이터가 목표를 하위 작업으로 나누어 클라우드 샌드박스에서 실행되는 전문 하위 에이전트에 할당하므로, 기기를 종료해도 작업이 계속 진행됩니다. 세션은 다시 재생할 수 있습니다 (Security Boulevard).

기능 범위: 자체 클라우드 환경 내에서 리서치, 데이터 추출, 스프레드시트, 양식 및 웹 앱 생성.

라이선스: 폐쇄형. 메타의 인수 발표는 2026년 4월 중국 규제 당국에 의해 차단되었으며, Manus는 독립적으로 운영됩니다.

가격: 일일 무료 크레딧 제공; Pro 버전 월 20달러부터 시작, 최대 월 200달러.

추천 대상: 리서치 비중이 높고 브라우저 기반의 업무를 위임하려는 개인.

제한 사항: 사용자의 데스크톱 앱이나 내부 시스템이 아닌, 자체 샌드박스 환경에서만 작동합니다.

‍

9. Browser Use (Browser Use): 가장 인기 있는 오픈 소스 브라우저 에이전트

작동 방식: MIT 라이선스가 적용된 라이브러리가 모든 LLM을 브라우저에 연결하며, Browser Use Cloud는 호스팅된 에이전트와 원격 브라우저를 추가로 제공합니다. 이 프로젝트는 GitHub에서 11만 7천 개의 별을 기록했습니다(Browser Use).

기능 범위: 브라우저 전용. BU Bench V1 테스트에서 해당 라이브러리를 사용한 Claude Fable 5는 80.0%, Browser Use Cloud는 78.0%의 점수를 기록했습니다.

라이선스: MIT.

가격: 라이브러리는 무료이며, 클라우드 에이전트는 모델 가격에 20%가 추가되고 브라우저 사용 시간이 별도로 청구됩니다.

추천 대상: 모든 모델을 사용하여 웹 에이전트를 구축하는 개발자.

제한 사항: 데스크톱 앱이나 OS 수준의 작업은 지원하지 않습니다.

‍

10. Browserbase 및 Stagehand (Browserbase): 에이전트를 위한 브라우저 인프라

작동 방식: Browserbase는 Playwright, Puppeteer, Selenium 및 오픈 소스 Stagehand 프레임워크를 위해 클라우드에서 헤드리스 브라우저를 실행하며, 세션 기록 및 관측 기능을 제공합니다 (Browserbase 요금제).

기능 범위: 클라우드 브라우저 제공; 에이전트 로직은 직접 구현하거나 Stagehand를 사용해야 합니다.

라이선스: 폐쇄형 인프라; Stagehand는 오픈 소스.

가격: 무료; Developer 월 20달러; Startup 월 99달러; Scale 맞춤형.

추천 대상: 다수의 브라우저 세션을 병렬로 실행하는 팀.

제한 사항: 브라우저 전용; 에이전트 품질은 구축 방식에 따라 달라집니다.

‍

11. Skyvern (스카이번): 비전 기반 브라우저 워크플로우 자동화

작동 방식: Skyvern은 AI를 통해 브라우저 워크플로우를 자동화하며, 캡차(CAPTCHA) 해결 및 2단계 인증 지원 기능을 갖추어 기존의 불안정한 스크래퍼를 대체합니다. GitHub 저장소는 23.1k개의 스타를 기록하고 있습니다(Skyvern 가격).

기능 범위: 웹사이트 및 웹 포털.

라이선스: 오픈소스 코어 및 클라우드 제공.

가격: 무료 5,000 크레딧 제공; Hobby 월 29달러; Pro 월 149달러; Enterprise는 SOC 2 및 HIPAA 준수 맞춤형 플랜.

추천 대상: 양식 입력이 많은 포털을 자동화해야 하는 운영 팀.

제한 사항: 브라우저 전용.

‍

12. Orgo (오르고): 나만의 에이전트를 위한 클라우드 데스크톱

작동 방식: Orgo는 데스크톱, 터미널, 파일 시스템을 갖춘 지속형 클라우드 컴퓨터를 제공하며, REST, SDK, CLI 또는 MCP를 통해 제어할 수 있습니다(Orgo).

기능 범위: 모든 플랜에서 Linux 지원, Scale 플랜에서 Windows 지원, Mac은 비공개 베타 서비스 중입니다. 모델과 에이전트는 직접 제공하셔야 합니다.

라이선스: 비공개.

가격: Hacker 월 29달러(컴퓨터 1대), Startup 월 99달러(4대), Scale 월 399달러(16대).

추천 대상: VM 인프라를 직접 구축하지 않고 호스팅된 데스크톱을 사용하려는 개발자.

제한 사항: 에이전트가 아닌 인프라 서비스이므로, 신뢰성은 사용자의 스택에 따라 달라집니다.

‍

13. Cua: 오픈소스 컴퓨터 사용 인프라

작동 방식: Cua 전체 데스크톱을 제어하는 에이전트를 학습 및 평가하기 위한 오픈소스 샌드박스, SDK, 벤치마크를 제공합니다.

지원 범위: macOS, Linux 및 Windows 샌드박스.

라이선스: 오픈소스.

가격: 자체 호스팅 시 무료.

추천 대상: 로컬에서 검사 가능한 인프라를 원하는 연구자 및 개발자.

제한 사항: 전체 스택을 직접 구축하고 운영해야 합니다.

‍

14. Agent S (Simular Research): 인간 기준치를 넘어선 오픈소스 프레임워크

작동 방식: Agent S 는 메인 모델(OpenAI, Anthropic, Gemini 등)과 UI-TARS와 같은 그라운딩 모델을 결합합니다. 다음 명령어로 설치하세요: pip install gui-agents를 확인하세요.

지원 범위: Linux, macOS 및 Windows 데스크톱. Agent S3는 OSWorld 1.0에서 best-of-N 기준 72.6%를 기록하여 인간 기준치인 72.36%를 상회했으며, 단독으로는 66%를 기록했습니다 (Simular).</

라이선스: Apache-2.0.

가격: 무료; 모델 사용 비용은 별도입니다.

추천 대상: 연구 및 자체 호스팅 실험.

제한 사항: 관리형 인프라가 아닌 프레임워크입니다. 프로덕션 환경에서는 Simular Platform API를 사용하세요.

‍

15. UI-TARS (ByteDance): 오픈 웨이트 GUI 모델

작동 방식: GUI 상호작용을 위해 학습된 시각-언어 모델; UI-TARS-2 는 OSWorld에서 47.5%, WindowsAgentArena에서 50.6%, AndroidWorld에서 73.3%의 성능을 기록했습니다.

지원 범위: 모델을 호스팅하는 모든 환경(데스크톱, 브라우저, Android 및 게임).

라이선스: Apache-2.0 (GitHub).</

가격: 무료 가중치, GPU 호스팅 비용 발생.

추천 대상: 온프레미스 또는 에어갭 환경 배포.

제한 사항: 환경 구축, 루프 및 복구 과정을 직접 구현해야 함.

‍

어떤 컴퓨터 사용 도구를 선택해야 할까요?

  • 인프라 구축 없이 실제 데스크톱에서 작업을 완료하고 싶다면: Sai 및 Simular Platform API를 확인하세요.
  • 나만의 에이전트 제품을 개발 중이라면: Orgo 또는 Cua 데스크톱 기반의 Anthropic, OpenAI, Gemini 모델 도구.
  • 브라우저 기반 워크플로우만 사용한다면: Browser Use, Browserbase, Skyvern 또는 Nova Act.
  • Microsoft 또는 UiPath 환경을 표준으로 사용한다면: Copilot Studio 또는 ScreenPlay.
  • 온프레미스 또는 연구용 제어가 필요하다면: UI-TARS를 활용한 Agent S.

나만의 워크플로우에 컴퓨터 사용 기능을 적용해 볼 준비가 되셨나요? Simular Platform API 키를 무료로 받으세요 또는 Sai로 시작하기를 확인하세요.

Stop doing repetitive tasks. Let Sai handle them for you.

Sai is your AI computer use agent — it operates your apps, automates your workflows, and gets work done while you focus on what matters.

Try Sai

자주 묻는 질문