
컴퓨터 사용은 AI 에이전트가 그래픽 인터페이스를 통해 소프트웨어를 조작할 수 있게 하는 기능입니다. 사람이 하는 것처럼 화면을 읽고, 마우스를 움직이고, 클릭하고, 타이핑하고, 스크롤하여 작업을 완료합니다. API가 아닌 인터페이스를 통해 작동하기 때문에, 컴퓨터 사용 기능은 데스크톱 앱, 사내 포털, 레거시 시스템 등 자동화를 위해 설계되지 않은 소프트웨어까지 자동화할 수 있습니다.
이 용어는 Anthropic이 Claude를 위한 컴퓨터 사용 기능을 발표한 2024년 10월에 AI 업계의 주류 용어로 자리 잡았습니다. 오늘날 주요 모델 연구소들은 모두 이 기능을 탑재한 버전을 출시하고 있으며, Microsoft Copilot Studio 및 UiPath ScreenPlay 와 같은 자동화 플랫폼들도 이를 제품에 통합하고 있습니다. 이 기능을 활용해 개발하고 싶다면 개발자를 위한 컴퓨터 사용 가이드를 읽어보세요. 소규모 비즈니스에 적용하고 싶다면 소규모 팀을 위한 컴퓨터 사용 가이드.
모든 컴퓨터 사용 에이전트는 작업이 완료될 때까지 동일한 루프를 반복합니다.
컴퓨터 자체는 일반적으로 개인의 노트북이 아닌 샌드박스 처리된 가상 머신이나 컨테이너입니다. Anthropic, OpenAI, Google과 같은 모델 제공업체는 동작을 반환하고 머신 제어는 사용자에게 맡기지만, 관리형 플랫폼은 머신과 루프를 대신 실행해 줍니다.
OSWorld는 홍콩대학교 XLANG Lab에서 개발했으며, 실제 운영 체제에서 369개의 실제 작업을 수행하도록 에이전트를 테스트합니다. 사람이 이 작업들을 완료하는 비율은 72.36%입니다. 더 최신 버전인 OSWorld 2.0 은 108개의 장기 과제를 포함하고 있으며, 사람이 이를 완료하는 데는 중앙값 기준 약 1.6시간이 소요되고 평균 318회의 도구 호출이 발생합니다.
컴퓨터 사용 도구는 다음 다섯 가지 그룹으로 나뉩니다: 관리형 에이전트 (컴퓨터를 직접 실행하고 완료된 결과물을 반환), 모델 수준 도구 (사용자가 실행할 작업을 제안), 엔터프라이즈 자동화 플랫폼 (기존 제품군에 컴퓨터 사용 기능 추가), 브라우저 전용 에이전트 및 인프라, 그리고 오픈 소스 프레임워크 및 모델. 올바른 선택은 단순한 정확도보다는 누가 기기를 운영하는지, 데스크톱 앱이 필요한지 아니면 브라우저만으로 충분한지, 그리고 작업 과정의 어느 정도까지 직접 제어하고 싶은지에 따라 달라집니다.
우리는 다섯 가지 기준에 따라 각 도구를 비교했습니다: 환경 커버리지(데스크톱, 브라우저, 모바일), 장기 작업에 대한 벤치마크 증거, 인프라 소유 주체, 반복 실행을 포함한 총비용, 그리고 승인 및 격리와 같은 안전 제어 기능입니다. 벤치마크 결과는 그 기반이 되는 벤치마크만큼만 유효합니다:

작동 방식: Sai는 최첨단 모델과 전문 모델을 조합하여 운영하는 컴퓨터 사용 에이전트입니다. UI 요소를 찾는 전용 모델과 단계가 실행되기 전 화면을 검증하는 판단 모델을 갖추고 있습니다. 이 에이전트는 더 긴 하위 작업을 Simulang 코드로 계획하여 클릭당 모델 호출 비용을 지불하는 대신, 해결된 절차를 코드로 컴파일하여 재실행하고 화면이 변경되면 스스로 복구합니다. 사용자는 Sai 앱을 통해 이를 사용하며, 개발자는 HTTPS 및 SSE를 통해, 또는 @simular-ai/sai-mcp 서버를 통해 Simular 플랫폼 API.
기능 범위: 데스크톱 앱, 브라우저, 파일 시스템 및 터미널을 지원하며, Simular의 Windows 또는 Linux 클라우드 컴퓨터나 사용자의 Mac 또는 Windows 기기에서 실행됩니다( Sai 가격 책정 FAQ참조). 장기적 관점의 OSWorld 2.0에서 Simular는 작업당 15.70달러의 비용으로 73.0%의 부분 점수를 기록하여, Claude Opus 5의 70.6%와 GPT-5.6 Sol의 62.6%를 앞섰습니다. 전체 작업 성공률은 28.25%입니다(Simular).
라이선스: Simular의 오픈 소스를 기반으로 구축된 폐쇄형 제품 Agent S 연구용; 자체 키나 온프레미스 모델을 포함한 모델 애그노스틱(model-agnostic) 방식.
가격: 공유 Windows 클라우드 컴퓨터를 사용하는 무료 플랜; 월 50달러 종량제; 월 500달러 무제한; 기업용 맞춤형 플랜.
추천 대상: 실제 데스크톱에서 작업을 완료하고자 하는 팀 및 개발자, 특히 실행할수록 비용이 절감되어야 하는 반복 업무에 적합합니다.
제한 사항: 관리형 에이전트이므로 모든 저수준 작업을 직접 스크립트로 작성할 필요는 없습니다. API는 사용자당 시간당 60개 메시지로 기본 설정되어 있으며, 신뢰가 쌓이기 전까지는 긴 작업에 대한 검토가 필요합니다.

작동 방식: 앱이 스크린샷과 computer_toolset_20260801 도구 정의를 Claude에 전송하면, Claude가 left_click, 입력 또는 확대/축소. 코드가 샌드박스 내에서 실행되고 다음 스크린샷을 반환합니다. Anthropic은 Docker 기반의 참조 구현.
기능 범위: 하네스가 노출하는 모든 환경. Claude API, Vertex AI 및 Bedrock을 통해 Claude Opus 4.8, 5 및 5.5, Sonnet 5 및 5.5, 그리고 Fable 및 Mythos 제품군에서 지원됩니다(Anthropic 문서).
라이선스: 폐쇄형 모델, 오픈 소스 참조 하네스.
가격: 표준 토큰당 API 요금 적용; 모든 단계마다 이미지가 전송되므로 작업이 길어질수록 비용이 누적됩니다.
추천 대상: 강력한 기반과 완전한 제어권을 원하는 자체 에이전트 제품을 구축 중인 엔지니어.
제한 사항: 완성된 제품이 아닙니다. 샌드박싱, 복구, 자격 증명 처리, 승인 및 감사 기능을 직접 구축해야 합니다.

작동 방식: The computer use API 는 computer 도구를 통해 구조화된 마우스 및 키보드 동작을 반환하거나, 모델이 Playwright 또는 PyAutoGUI 코드를 작성하도록 합니다. 코드 경로에는 GPT-6 Astra 사용을 권장합니다. 앱 내에서 ChatGPT Work는 2026년 7월 9일에 출시되었으며, 문서, 연결된 앱, 브라우저를 활용한 장기 작업을 처리합니다.
기능 범위: API: 사용자가 제공하는 브라우저 또는 데스크톱 환경. Work: ChatGPT 내부에서 연구 및 문서 작업에 최적화. OpenAI의 초기 에이전트였던 Operator는 2025년 8월 31일에 서비스가 종료되었습니다.
라이선스: 비공개.
가격: API는 토큰당 과금, Work는 유료 ChatGPT 플랜에 포함.
추천 대상: 코드 기반 자동화를 선호하는 개발자, 연구 중심 업무를 위한 에이전트가 필요한 ChatGPT 사용자.
제한 사항: API는 런타임 환경을 사용자가 직접 구축해야 하며, Work는 레거시 데스크톱 소프트웨어 운영을 위해 설계되지 않았습니다.

작동 방식: Gemini는 브라우저, 모바일 및 데스크톱 환경을 위해 0~999로 정규화된 좌표 그리드에서 작업을 수행합니다. 권장 모델은 Gemini 3.8 Flash이며, 컴퓨터 사용 기능은 다음 시점부터 내장 도구로 제공되었습니다. 2026년 6월 Gemini 3.5 Flash.
기능 범위: 어떤 클라이언트 환경을 구현하든 상관없습니다. Google은 Docker 기반 참조를 제공합니다(Gemini 문서).
라이선스: 폐쇄형 모델.
가격: 토큰당 Gemini API 요금 적용.
추천 대상: 웹 작업과 함께 Android 자동화가 필요한 팀.
제한 사항: 현재 미리 보기 단계입니다. Google은 오류 및 보안 취약점이 포함될 수 있다고 경고합니다. 내장된 확인 절차는 구매, 민감한 데이터 처리, 통신, 계정 생성 및 법적 계약에 적용됩니다.
작동 방식: Copilot Studio 컴퓨터 사용 기능은 로우코드 에이전트가 웹사이트와 데스크톱 앱을 조작할 수 있게 해줍니다. 컴퓨터 사용 에이전트는 다음 시점에 정식 출시되었습니다. 2026년 5월 정식 출시 안전한 자격 증명 관리를 제공합니다. 개발자를 위한 Foundry 컴퓨터 사용 도구 는 코드가 실행할 작업을 제안합니다.
기능 범위: 브라우저 및 데스크톱 앱; Foundry 도구는 computer-use-preview 모델을 3개의 Azure 리전에서 사용합니다.
라이선스: 비공개.
가격: Microsoft 라이선스 적용; Foundry는 사용량 기준 과금.
추천 대상: Microsoft 365, Entra 및 Azure를 표준으로 사용하는 조직.
제한 사항: Foundry 도구는 현재 미리 보기 단계로 SLA가 제공되지 않으며, 작업 수행 전 안전 점검 사항을 확인해야 합니다.

작동 방식: ScreenPlay 는 자연어 지침을 실시간 화면을 읽고 변화에 적응하는 UI 자동화로 변환하며, 타사 또는 UiPath 모델을 사용합니다. 이 도구의 Screen Agent는 OSWorld-Verified에서 67.1%로 1위를 차지했습니다. 2026년 1월 Claude Opus 4.5 기준.
기능 범위: UiPath Orchestrator 및 AI Trust Layer로 제어되는 Windows, Linux 및 macOS 앱.
라이선스: 폐쇄형, SaaS 또는 자체 호스팅.
가격: 기업용 계약.
추천 대상: 기존 UiPath 환경을 보유한 기업.
제한 사항: 기업용 RPA 팀을 위해 구축되었으며, 소규모 팀이 도입하기에는 다소 무거움.

작동 방식: 자연어와 Python으로 워크플로우를 정의하고, 플레이그라운드에서 테스트한 뒤 Bedrock AgentCore 런타임에 배포하세요. Nova Act 는 2025년 12월 2일에 정식 출시되었습니다.
기능 범위: QA 테스트, 양식 작성, 데이터 추출과 같은 브라우저 워크플로우.
라이선스: 폐쇄형 서비스, 오픈소스 SDK.
가격: 활성 작업 시간당 에이전트당 4.75달러 ( Classmethod의 정식 출시 리뷰.
추천 대상: 웹 워크플로우를 자동화하는 AWS 네이티브 팀.
제한 사항: 브라우저 중심, 미국 동부 리전에서만 출시.

작동 방식: 오케스트레이터가 목표를 하위 작업으로 나누어 클라우드 샌드박스에서 실행되는 전문 하위 에이전트에 할당하므로, 기기를 종료해도 작업이 계속 진행됩니다. 세션은 다시 재생할 수 있습니다 (Security Boulevard).
기능 범위: 자체 클라우드 환경 내에서 리서치, 데이터 추출, 스프레드시트, 양식 및 웹 앱 생성.
라이선스: 폐쇄형. 메타의 인수 발표는 2026년 4월 중국 규제 당국에 의해 차단되었으며, Manus는 독립적으로 운영됩니다.
가격: 일일 무료 크레딧 제공; Pro 버전 월 20달러부터 시작, 최대 월 200달러.
추천 대상: 리서치 비중이 높고 브라우저 기반의 업무를 위임하려는 개인.
제한 사항: 사용자의 데스크톱 앱이나 내부 시스템이 아닌, 자체 샌드박스 환경에서만 작동합니다.

작동 방식: MIT 라이선스가 적용된 라이브러리가 모든 LLM을 브라우저에 연결하며, Browser Use Cloud는 호스팅된 에이전트와 원격 브라우저를 추가로 제공합니다. 이 프로젝트는 GitHub에서 11만 7천 개의 별을 기록했습니다(Browser Use).
기능 범위: 브라우저 전용. BU Bench V1 테스트에서 해당 라이브러리를 사용한 Claude Fable 5는 80.0%, Browser Use Cloud는 78.0%의 점수를 기록했습니다.
라이선스: MIT.
가격: 라이브러리는 무료이며, 클라우드 에이전트는 모델 가격에 20%가 추가되고 브라우저 사용 시간이 별도로 청구됩니다.
추천 대상: 모든 모델을 사용하여 웹 에이전트를 구축하는 개발자.
제한 사항: 데스크톱 앱이나 OS 수준의 작업은 지원하지 않습니다.
작동 방식: Browserbase는 Playwright, Puppeteer, Selenium 및 오픈 소스 Stagehand 프레임워크를 위해 클라우드에서 헤드리스 브라우저를 실행하며, 세션 기록 및 관측 기능을 제공합니다 (Browserbase 요금제).
기능 범위: 클라우드 브라우저 제공; 에이전트 로직은 직접 구현하거나 Stagehand를 사용해야 합니다.
라이선스: 폐쇄형 인프라; Stagehand는 오픈 소스.
가격: 무료; Developer 월 20달러; Startup 월 99달러; Scale 맞춤형.
추천 대상: 다수의 브라우저 세션을 병렬로 실행하는 팀.
제한 사항: 브라우저 전용; 에이전트 품질은 구축 방식에 따라 달라집니다.
작동 방식: Skyvern은 AI를 통해 브라우저 워크플로우를 자동화하며, 캡차(CAPTCHA) 해결 및 2단계 인증 지원 기능을 갖추어 기존의 불안정한 스크래퍼를 대체합니다. GitHub 저장소는 23.1k개의 스타를 기록하고 있습니다(Skyvern 가격).
기능 범위: 웹사이트 및 웹 포털.
라이선스: 오픈소스 코어 및 클라우드 제공.
가격: 무료 5,000 크레딧 제공; Hobby 월 29달러; Pro 월 149달러; Enterprise는 SOC 2 및 HIPAA 준수 맞춤형 플랜.
추천 대상: 양식 입력이 많은 포털을 자동화해야 하는 운영 팀.
제한 사항: 브라우저 전용.
작동 방식: Orgo는 데스크톱, 터미널, 파일 시스템을 갖춘 지속형 클라우드 컴퓨터를 제공하며, REST, SDK, CLI 또는 MCP를 통해 제어할 수 있습니다(Orgo).
기능 범위: 모든 플랜에서 Linux 지원, Scale 플랜에서 Windows 지원, Mac은 비공개 베타 서비스 중입니다. 모델과 에이전트는 직접 제공하셔야 합니다.
라이선스: 비공개.
가격: Hacker 월 29달러(컴퓨터 1대), Startup 월 99달러(4대), Scale 월 399달러(16대).
추천 대상: VM 인프라를 직접 구축하지 않고 호스팅된 데스크톱을 사용하려는 개발자.
제한 사항: 에이전트가 아닌 인프라 서비스이므로, 신뢰성은 사용자의 스택에 따라 달라집니다.
작동 방식: Cua 전체 데스크톱을 제어하는 에이전트를 학습 및 평가하기 위한 오픈소스 샌드박스, SDK, 벤치마크를 제공합니다.
지원 범위: macOS, Linux 및 Windows 샌드박스.
라이선스: 오픈소스.
가격: 자체 호스팅 시 무료.
추천 대상: 로컬에서 검사 가능한 인프라를 원하는 연구자 및 개발자.
제한 사항: 전체 스택을 직접 구축하고 운영해야 합니다.
작동 방식: Agent S 는 메인 모델(OpenAI, Anthropic, Gemini 등)과 UI-TARS와 같은 그라운딩 모델을 결합합니다. 다음 명령어로 설치하세요: pip install gui-agents를 확인하세요.
지원 범위: Linux, macOS 및 Windows 데스크톱. Agent S3는 OSWorld 1.0에서 best-of-N 기준 72.6%를 기록하여 인간 기준치인 72.36%를 상회했으며, 단독으로는 66%를 기록했습니다 (Simular).</
라이선스: Apache-2.0.
가격: 무료; 모델 사용 비용은 별도입니다.
추천 대상: 연구 및 자체 호스팅 실험.
제한 사항: 관리형 인프라가 아닌 프레임워크입니다. 프로덕션 환경에서는 Simular Platform API를 사용하세요.
작동 방식: GUI 상호작용을 위해 학습된 시각-언어 모델; UI-TARS-2 는 OSWorld에서 47.5%, WindowsAgentArena에서 50.6%, AndroidWorld에서 73.3%의 성능을 기록했습니다.
지원 범위: 모델을 호스팅하는 모든 환경(데스크톱, 브라우저, Android 및 게임).
라이선스: Apache-2.0 (GitHub).</
가격: 무료 가중치, GPU 호스팅 비용 발생.
추천 대상: 온프레미스 또는 에어갭 환경 배포.
제한 사항: 환경 구축, 루프 및 복구 과정을 직접 구현해야 함.
나만의 워크플로우에 컴퓨터 사용 기능을 적용해 볼 준비가 되셨나요? Simular Platform API 키를 무료로 받으세요 또는 Sai로 시작하기를 확인하세요.