연구

SimuLang을 소개합니다: 데스크톱 전체를 위한 Playwright

캘리포니아주 팔로알토 • 2026년 8월 28일 • 작성: Simular 팀  

Simulang은 AI 에이전트가 작성하도록 설계된, 브라우저, 네이티브 앱 및 OS 수준 워크플로우를 자동화하기 위한 스크립팅 언어입니다. 저희는 방금 Simulang을 오픈 소스로 공개했습니다. 지금 단 하나의 명령어로 설치할 수 있습니다:

Sai는 Simular가 구축한 컴퓨터 에이전트로, 숙련된 인간이 완료하는 데 1시간 이상 소요되는 길고 복잡한 일상 업무를 측정하는 108개 작업 벤치마크인 OSWorld 2.0에서 73%의 성공률을 달성했습니다.

이러한 최첨단 성능을 통해 Sai는 OpenAI가 보고한 GPT-5.6 Sol의 62.57%와 Anthropic이 보고한 Opus 5의 70.57%를 앞질렀으며, 두 모델 대비 약 3분의 2 수준의 비용으로 최고 점수를 기록했습니다.

Sai는 인간처럼 데스크톱 애플리케이션과 웹페이지를 조작하고, API를 호출하며, 코드를 작성하는 컴퓨터 에이전트입니다. 최신 모델과 전문 모델을 혼합하여 운영하고, 전용 인터페이스를 통해 컴퓨터를 인식 및 제어하며, Simular의 원격 머신과 개인용 컴퓨터 모두에서 실행됩니다. OSWorld 2.0의 이정표는 Sai가 일상적인 업무를 수행하는 개인과 확장 가능한 배포가 필요한 기업 모두에게 합리적인 비용으로 복잡한 실무 작업을 실행할 수 있음을 보여줍니다.

홍콩대학교 XLANG Lab이 6월에 발표한 OSWorld 2.0 벤치마크는 통제된 리눅스 환경에서 장기적인 실무 작업을 다룹니다. OSWorld 1.0 벤치마크와 달리 OSWorld 2.0 작업은 분 단위가 아닌 시간 단위로 측정됩니다. 이 벤치마크는 여러 데이터 소스(예: 이메일과 경비 보고서에 흩어진 영수증)를 찾고 추론하기, 동적인 환경 변화(예: 작업 도중 도착한 메시지)에 대응하기, 지침(예: 상환 가이드라인)을 정확하게 따르기, 정보 불일치(예: 상충하는 데이터) 해결하기와 같은 실제적인 과제를 제시합니다. 따라서 Simular 팀은 현재 업계에서 실제 작업을 가장 잘 반영하는 가장 강력한 오픈 벤치마크라고 판단하고 있습니다.

결과

순수 모델의 경우 성공률이 높을수록 비용도 증가합니다. Sai는 이러한 곡선을 깨뜨렸습니다. 차트에서 가장 높은 점수를 기록하면서도 경쟁 모델 대비 3분의 2 미만의 비용으로 운영됩니다.

OSWorld 2.0에서의 부분 점수 및 작업당 API 비용입니다. Sai는 작업당 $15.70의 비용으로 73.0%의 부분 점수를 달성하여, Claude Opus 5 Max Thinking(작업당 $23.70에 70.6%) 및 GPT-5.6 Sol Max(작업당 $26.62에 62.6%)보다 훨씬 저렴한 비용으로 더 뛰어난 성능을 보였습니다.

OSWorld 2.0에서의 이진 성공률입니다. Sai는 28.25%를 기록하여 GPT-5.6 Sol의 23.14%와 Claude Opus 4.7의 13.10%를 앞섰습니다.

Sai가 이러한 우수한 결과-비용 효율성을 달성하는 방법은 다음과 같습니다:

  1. 신경-기호적 계획(Neuro-symbolic planning): Sai는 Simulang 코드를 계획 및 긴 하위 작업을 실행하기 위한 강력한 기호 언어로 활용하여 턴당 더 많은 작업을 수행함으로써, 순수 모델 대비 평균 약 1.5배 적은 모델 호출로 동일한 결과를 도출합니다.
  2. 효율적인 캐싱 및 메모리: Sai는 적응형 요약을 통해 입력 크기를 제한하고, 요약 전까지는 최대한 일정한 프롬프트 접두사를 유지합니다. 코드를 통한 계획 수립으로 Sai는 작업 전체 실행 과정에서 중요한 정보를 런타임 메모리에 유지하고 액세스할 수 있습니다.
  3. 모델 오케스트레이션: Sai는 UI 요소 위치 파악, 순수 추론, 검증을 위해 전문 모델과 인터페이스를 호출합니다. 이를 통해 전체 작업 맥락이 필요하지 않은 단계에서는 비용이 많이 드는 모델 사용을 피합니다.

작동 방식: 점수의 근거

신뢰성과 효율성 측면에서 Sai, GPT 5.6 Sol, Opus를 나란히 비교한 두 가지 작업입니다.

1. 작업 68: 크롬 공룡 게임

에이전트는 반복적인 실시간 게임인 크롬 공룡 게임을 플레이하여 라이브 페이지에서 목표 점수를 달성해야 합니다. 최종 점수를 기준으로 성공 여부가 결정되는데, 세 에이전트 모두 1.0점을 기록했으므로 이들을 구분 짓는 것은 목표 달성에 드는 비용입니다. Sai는 23번의 모델 턴 만에 완료했고, Sol은 46번, Opus 4.7은 201번이 필요했습니다.

Sai는 반복적인 실시간 게임을 클릭 문제가 아닌 프로그래밍 문제로 접근했습니다. Sai는 원본 픽셀에서 지면 라인, 장애물 속도, 자체 입력 지연 시간을 측정했습니다. 그런 다음 화면을 캡처하고 장애물을 감지하여 점프하는 제어 루프를 작성하고, 단일 실행 호출 내에서 가상 머신(VM) 상에 해당 루프를 실행했습니다. 4가지 버전의 코드와 23번의 턴을 거쳐 93초 동안 96번의 깔끔한 점프를 성공시키며 목표치의 6배에 가까운 768점을 기록했고, 작업을 완료하기 전 화면의 점수를 다시 읽어 확인했습니다.

반면 Sol은 같은 아이디어에 도달한 후 pyautogui.typewrite를 통해 터미널에 키 입력을 하나씩 타이핑하며 5번이나 다시 작성했습니다. Opus 4.7은 게임 플레이를 완전히 포기하고 개발자 도구(DevTools)를 열어 게임 점수 변수를 수동으로 150으로 설정한 뒤 서버로 전송했습니다. 그 점수는 획득한 것이 아니라 작성된 것이었습니다. 이전 평가 방식에서는 통과되었을지 모르나, 현재 평가 방식에서는 개발자 도구를 건드리는 모든 실행을 0점 처리합니다.

2. 작업 28: 백신 예약

작업 28은 필수 예방 접종에 관한 이메일, 데스크톱에 있는 스캔된 예방 접종 기록, 그리고 가격, 거리, 날짜 제약 조건이 있는 예약 사이트를 다루는 것입니다. 요구 사항에는 B형 간염 접종 간격 규칙이 포함되어 있습니다. 3차 접종은 1차 접종 후 최소 16주, 2차 접종 후 최소 8주가 지나야 합니다. 기록상 70일과 40일 간격으로 3회 접종을 받았으므로 4차 예약이 필요한 상황입니다. Sai는 1.0점을, Opus 4.7은 0.4점을, Sol은 0.0점을 기록했습니다.

Sai는 단순히 내용을 옮겨 적는 대신 정보를 추출했습니다. Sai는 두 PDF 모두에 pdftotext를 실행하고 스캔된 기록을 300dpi로 다시 렌더링하여 수기 항목을 읽어냈습니다. 그런 다음 환자 세부 정보를 데이터(BUYER = { name: "Jeniffer", … })로 보유하고 해당 변수를 모든 양식에 입력했습니다. 반면 Sol은 문서 뷰어에서 PDF를 시각적으로 읽고 기억에 의존해 "Jennifer"를 네 번 다시 입력했으며, 사이트는 이를 별다른 확인 없이 수락했습니다.

또한 Sai는 요구 사항을 체크리스트가 아닌 규칙으로 해석했습니다. 접종 간격 조건은 날짜 계산이 필요한 규칙이며, Sai는 이를 정확히 계산했습니다. Opus 4.7은 3회 접종 횟수만 세고 "B형 간염: ✓ 완료"라고 표시하며 작업의 4분의 1을 누락했습니다. 작업을 완료했다고 선언하기 전, Sai는 ~/Downloads에 있는 4개의 예약 JSON을 모두 다시 읽고 백신, 병원, 날짜, 시간, 가격이 각각 일치하는지 확인했습니다. Sol의 확인 페이지에는 "예약 성공 — 이름: Jennifer"라고만 표시되었을 뿐, 원본 데이터와 대조하는 과정은 없었습니다. Opus 4.7도 JSON을 출력했지만 3개만 존재했고, 모든 것이 예약되었다는 요약문을 작성했습니다.

Sai는 실험실의 결과물이 아닌, 모두를 위한 도구입니다

Simular는 2023년부터 컴퓨터 사용 에이전트(CUA) 분야를 연구하며 그 한계를 넓혀왔습니다. 2025년 12월, Simular의 오픈소스 CUA인 Agent S는 OSWorld 1.0에서 인간 수준의 성능을 달성한 최초의 에이전트가 되었으며, 인간 기준치인 72.36%에 맞서 72.6%의 점수를 기록했습니다.

저희 연구팀은 Agent S 프레임워크 제품군을 구축하고 오픈소스로 공개하며, 제품팀은 자체 클라우드 데스크톱에서 실행되어 실제 고객의 업무를 처리하는 컴퓨터 에이전트 'Sai'를 제공합니다. 이러한 결합을 통해 저희 연구는 단순한 데모에 그치지 않고 경제적 가치가 있는 실무에 집중할 수 있습니다. 또한 모델, 계획 및 접지(grounding), 스크립팅 계층, 에이전트가 실행되는 가상 머신, 사용자 인터페이스 등 컴퓨터 에이전트의 전체 스택을 깊이 이해하고 있습니다.

오늘날 벤치마크 성능과 실제 프로덕션 요구 사항 사이에는 간극이 존재합니다. Simular를 비롯한 여러 기업이 OSWorld 1.0에서 인간의 성공률을 넘어섰고, 이제 Sai는 OSWorld 2.0을 선도하고 있습니다. 하지만 인간 수준의 속도, 비용, 신뢰성을 달성하는 것이 저희의 궁극적인 목표입니다. 벤치마크는 독립적인 시도에 대한 성공률인 pass@k를 보고하지만, 실제 업무에서는 매번 일관된 성공이 요구됩니다. 백 번째 실행에서도 마찬가지입니다. 이 간극이야말로 저희의 신경-기호(neuro-symbolic) 접근 방식이 해결하고자 하는 문제입니다.

대부분의 업무는 반복적입니다. Sai의 강점은 일상적인 작업을 저렴하고 안정적으로 수행하는 데 있습니다. 매일 아침 받은 편지함을 요약하거나 한 달 치 송장을 정리하는 일 등이 그 예입니다. 저희의 신경-기호 방식은 신경망의 탐색 능력과 기호 코드의 정밀함을 결합하여 신뢰성과 비용 절감 효과를 동시에 제공합니다. Sai가 새로운 작업을 한 번 완료하면, 그 해결책은 매번 동일하게 재현되는 견고한 코드로 남게 됩니다. 따라서 백 번째 송장을 처리할 때는 첫 번째보다 훨씬 적은 비용이 듭니다.

저희는 반복적인 클릭, 타이핑, 커서 이동과 같은 디지털 노동으로부터 인간을 해방하기 위해 Simular를 설립했습니다. 디지털 노동으로부터 사람들을 해방하려면 유능할 뿐만 아니라 신뢰할 수 있고 비용 효율적인 에이전트가 필요합니다. 그것이 바로 저희가 지향하는 기준입니다.

감사의 글

이 작업은 Simular 팀 전체의 성과물입니다. Sai의 기반 연구, 제품 엔지니어링, 평가 인프라, 그리고 이 글은 많은 이들의 손을 거쳐 완성되었기에, 우리는 이를 함께 만든 결과물로 기록합니다. 본 결과의 기반이 된 OSWorld 2 평가를 총괄한 Darrow Hartman에게 특별한 감사를 전합니다.

자율 컴퓨터를 만든다고 해서 인간을 대체하는 것은 아닙니다.협력을 의미하죠.

컴퓨터에서 손을 떼십시오.지금 Simular를 무료로 다운로드하세요.

시뮬러 사용해보기
button-arrow