
Um agente de uso de computador é um sistema de IA que opera um computador da mesma forma que uma pessoa: ele observa a tela, move o cursor, clica, digita, rola a página, alterna entre janelas e lê o resultado antes de decidir o próximo passo. Em vez de chamar uma API disponibilizada por um fornecedor, ele controla a interface que já existe.
Essa distinção é importante porque a maior parte do trabalho real ainda acontece em interfaces sem API: um console administrativo interno, um portal de fornecedores, um cliente de ERP desktop, um CRM legado, uma planilha que três equipes editam manualmente. Um agente de uso de computador é a única categoria de automação que alcança esses sistemas sem a necessidade de um projeto de integração.
Este guia aborda o que essa categoria realmente é, como ela difere de RPA e de agentes de navegador, o que os benchmarks medem (e onde eles podem induzir ao erro) e 22 ferramentas que vale a pena conhecer em 2026 — cada uma com sua abordagem subjacente, limites de capacidade, licenciamento, precificação, perfil de usuário ideal e limitações reais.
Todo agente de uso de computador executa o mesmo ciclo:
O desafio de engenharia interessante reside quase inteiramente nas etapas 2 e 4. O mapeamento é o que diferencia um agente que clica na célula correta em uma planilha daquele que clica 40 pixels à esquerda. A verificação é o que separa um agente que você pode deixar rodando sozinho de uma demonstração que parece ótima apenas uma vez.
Três benchmarks dominam a conversa. Nenhum deles reflete exatamente a sua carga de trabalho, mas, juntos, eles indicam quais sistemas são realmente capazes de fechar um ciclo.

Um agente de uso de computador que roda na sua própria máquina e funciona em todos os aplicativos instalados, não apenas no navegador.
Como funciona. Sai combina dados de acessibilidade do sistema operacional com reconhecimento visual, permitindo interagir com um botão através do seu nó de acessibilidade quando disponível, ou recorrer aos pixels quando não estiver. Ele roda em uma máquina real — seu laptop ou um ambiente de trabalho na nuvem — o que significa que ele herda suas sessões logadas, seus arquivos locais e sua rede, sem exigir que você se autentique novamente dentro de um ambiente isolado.
Limites de capacidade. Fluxos de trabalho entre aplicativos são o foco principal: extrair registros de um CRM, conciliá-los com uma planilha, registrar exceções em uma ferramenta de chamados, enviar o resumo por e-mail. Ele lida com aplicativos de desktop e caixas de diálogo de arquivos, não apenas páginas da web, e pode receber tarefas em linguagem natural ou ser executado de forma autônoma conforme um agendamento ou gatilho.
Licenciamento. Produto de código fechado. A equipe também publica pesquisas abertas nesta categoria (veja o Agent S, abaixo).
Preços. Plano gratuito com uma cota limitada de tempo de uso do computador; planos pagos para uso mais intenso e autônomo. Consulte a página de preços atual antes de planejar seu orçamento.
Ideal para. Equipes de operações, finanças e GTM cujo trabalho abrange diversas ferramentas — pelo menos uma das quais não possui API utilizável — e que desejam que o agente atue como seu próprio usuário logado, em vez de usar uma conta de serviço.
Limitações. Ele precisa de uma máquina para operar, portanto não é uma API em nuvem sem pegada de infraestrutura. Como todo agente nesta categoria, ele é mais lento e custoso por etapa do que um script codificado, e uma tarefa que é executada 10.000 vezes ao dia em uma interface estável ainda é melhor atendida por RPA ou uma integração direta.

Agente hospedado da OpenAI que navega e opera um computador virtual dentro do ChatGPT.
Como funciona. Uma máquina virtual hospedada na nuvem com navegador, terminal e manipulação de arquivos. O agente raciocina com base em capturas de tela e na estrutura da página, podendo alternar entre um navegador visual e um navegador de texto, dependendo da tarefa. O Operator, a versão de pesquisa anterior focada apenas no navegador, foi incorporado a este agente unificado.
Limites de capacidade. Forte em pesquisa, preenchimento de formulários e produção de artefatos (slides, planilhas) a partir de trabalho na web. Ele é executado no sandbox da OpenAI, portanto não acessa sua área de trabalho, seus arquivos locais ou sua rede interna, a menos que você os carregue ou conecte. Ações sensíveis exigem confirmação.
Licenciamento. Código fechado, apenas hospedado. Preços. Incluído nos planos ChatGPT Plus / Pro / Business com limites de uso por nível.
Ideal para. Indivíduos e equipes já padronizados no ChatGPT que precisam de trabalho com agentes voltado para a web sem a necessidade de gerenciar infraestrutura.
Limitações. Sem acesso a sistemas locais ou on-premise; sites que bloqueiam IPs de data centers ou exigem sua própria sessão logada são um ponto de atrito recorrente; não pode ser auto-hospedado.

A funcionalidade de API que transformou o "uso de computador" em uma categoria de produto — um modelo que retorna ações de mouse e teclado a partir de capturas de tela.
Como funciona. Um ciclo de uso de ferramentas: você envia ao Claude uma captura de tela e a definição da ferramenta, ele retorna uma ação (clique em coordenadas, digitar, tecla, rolar), seu sistema a executa e envia a próxima captura de tela de volta. A Anthropic fornece imagens de contêiner de referência; o ciclo em si é você quem executa. O Claude para Chrome aplica a mesma ideia dentro de uma extensão de navegador.
Limites da funcionalidade. O que quer que seu sistema exponha — um contêiner, uma máquina virtual ou uma área de trabalho real. Os modelos da Anthropic atualmente lideram o ranking OSWorld-Verified, portanto, a qualidade básica de fundamentação é de ponta.
Licenciamento. Modelo fechado, sistema de referência aberto. Preços. Preços padrão de tokens de API; o uso de computador consome muitos tokens porque cada etapa envia uma imagem.
Ideal para. Equipes de engenharia que estão criando seu próprio produto de agente ou sistema interno com o modelo de fundamentação mais robusto disponível.
Limitações. É uma funcionalidade, não um produto finalizado — você é responsável pelo sandbox, novas tentativas, verificação, credenciais e trilha de auditoria. O custo por tarefa concluída é alto em comparação com ferramentas voltadas para navegadores.

Um agente de codificação nativo do terminal que opera um repositório, um shell e, cada vez mais, um navegador.
Como funciona. Executa no seu terminal (ou IDE), lê e edita arquivos, executa comandos e itera com base nos resultados dos testes. Não é um agente de interface gráfica (GUI) no sentido estrito, mas pertence a esta lista porque, para fluxos de trabalho de desenvolvedores, ele substitui o que um agente de uso de computador faria lentamente através de uma interface.
Limites de capacidade. Excelente em código, sistemas de build, migrações e qualquer coisa que possa ser expressa como arquivos e comandos. Ele pode controlar um navegador para testes via servidores MCP, mas não foi criado para clicar em sistemas ERP.
Licenciamento. Código fechado; disponível com assinaturas do Claude e chaves de API. Preço. Incluído nos planos Claude Pro/Max ou cobrado conforme o uso da API.
Ideal para. Engenheiros. Limitações. Apenas tarefas voltadas para desenvolvedores; usuários não técnicos não obterão valor de uma interface focada no terminal.
A capacidade de agente de controle de navegador do Google, disponibilizada tanto como uma ferramenta de modelo quanto como um protótipo de pesquisa.
Como funciona. Uma variante de modelo treinada para emitir ações de navegador (clicar, digitar, rolar, navegar) a partir de capturas de tela e contexto da página, com o Mariner atuando como a experiência no Chrome que executa tarefas em várias abas em nome do usuário.
Limites de capacidade. Focado no navegador. Robusto em navegação web e formulários; não projetado para aplicações desktop.
Licenciamento. Fechado. Preços. Acesso ao modelo cobrado por token via API do Gemini; o acesso ao Mariner está restrito a planos de assinatura de IA superiores.
Ideal para. Equipes que já utilizam Google Cloud / Gemini e desejam controle de navegador dentro do mesmo ciclo de faturamento.
Limitações. A disponibilidade e a nomenclatura mudaram repetidamente — verifique o status atual antes de planejar sua implementação. Sem escopo para desktop.

Um agente geral hospedado que planeja tarefas longas e as executa em uma máquina virtual na nuvem.
Como funciona. Decomposição de tarefas aliada a uma VM em ambiente isolado (sandbox) com navegador, terminal e sistema de arquivos. Funciona de forma assíncrona — você define um objetivo e retorna para conferir o resultado (um relatório, um site, uma planilha).
Limites de capacidade. Pesquisa web abrangente e produção de artefatos; o ambiente isolado não possui conexão com seus sistemas internos.
Licenciamento. Fechado, hospedado. Preços. Planos de assinatura baseados em créditos; execuções longas consomem créditos rapidamente.
Ideal para. Trabalhos de pesquisa e entrega onde o resultado é um documento, não uma alteração dentro dos seus sistemas.
Limitações. O consumo de créditos é difícil de prever; sem acesso a software local ou on-premise; você está confiando a uma VM de terceiros qualquer credencial que digitar nela.
A biblioteca de código aberto mais amplamente adotada para permitir que um LLM controle um navegador.
Como funciona. Playwright por baixo do capô, com a página destilada em uma lista indexada de elementos interativos que o modelo seleciona por número — muito mais barato e confiável do que o processamento de pixels brutos.
Limite de capacidade. Qualquer coisa dentro do Chromium. Existe uma opção de nuvem hospedada para equipes que não desejam executar por conta própria.
Licenciamento. Código aberto (MIT). Preços. Gratuito para auto-hospedagem; nível de nuvem cobrado por uso. Os tokens do modelo são por sua conta.
Ideal para. Desenvolvedores que criam automação web e desejam controle total e uma grande comunidade.
Limitações. Limitado ao navegador por definição; você fornece a camada de confiabilidade (tentativas, verificação, segredos); a qualidade depende muito do modelo que você utiliza.
Um agente de código aberto que escreve e executa código localmente para realizar tarefas, com um modo de sistema operacional para controle de interface gráfica.
Como funciona. O modelo gera código em Python, shell ou JavaScript, sua máquina o executa e o resultado retorna ao ciclo. Um modo de sistema operacional opcional adiciona controle de mouse e teclado baseado em capturas de tela.
Limites de capacidade. Muito ampla para qualquer coisa que possa ser automatizada via script — manipulação de arquivos, conversão de dados, administração de sistemas. O controle de interface gráfica existe, mas é menos maduro do que em soluções dedicadas.
Licenciamento. Código aberto (AGPL-3.0). Preço. Gratuito; você paga pelos custos do modelo.
Ideal para. Usuários técnicos que desejam um agente local, independente de modelo, com acesso real à máquina.
Limitações. Executar código gerado por modelos na sua própria máquina é um risco real — utilize um ambiente isolado (sandbox). A precisão no modo GUI ainda está atrás dos líderes.
Um framework de código aberto compacto que permite que modelos multimodais operem um computador através de capturas de tela.
Como funciona. Captura de tela → modelo → ação de mouse/teclado, com backends conectáveis (classe GPT, Gemini, Claude ou modelos de visão locais).
Limites de capacidade. Mais uma implementação de referência e ferramenta de ensino do que um sistema de produção.
Licenciamento. Código aberto (MIT). Preço. Gratuito; os custos do modelo são por sua conta.
Ideal para. Aprender como o ciclo funciona ou iniciar um protótipo. Limitações. Cliques baseados em coordenadas são frágeis; há pouco em termos de verificação, recuperação ou gerenciamento de credenciais.

Um framework de agentes de código aberto para uso em computador, e uma das arquiteturas de referência na literatura de pesquisa.
Como funciona. Modular por design: um planejador, memória aumentada por experiência que reutiliza lições de execuções anteriores e um módulo de fundamentação que transforma intenções em coordenadas precisas. Versões posteriores decompõem o problema em módulos especializados, em vez de pedir que um único modelo faça tudo.
Limites de capacidade. Desktop completo, avaliado no OSWorld, WindowsAgentArena e AndroidWorld.
Licenciamento. Código aberto. Preço. Gratuito; os custos do modelo são por sua conta.
Ideal para. Pesquisadores e engenheiros que desejam uma base sólida e publicada para construir seus projetos, em vez de uma caixa-preta.
Limitações. Um framework, não um produto — sem interface, sem contrato de suporte e você mesmo monta a estrutura operacional.

Um modelo de agente de GUI nativo com pesos abertos — a principal alternativa aberta aos modelos de fundamentação fechados.
Como funciona. Um modelo único de visão e linguagem treinado de ponta a ponta em percepção, fundamentação e ação de interface gráfica (GUI), em vez de um pipeline orquestrado por prompts. Disponibilizado junto com o UI-TARS-desktop, um aplicativo que o executa diretamente na sua tela.
Limites de capacidade. Controle de GUI para desktop e dispositivos móveis; os resultados de código aberto mais robustos em benchmarks da categoria OSWorld (o UI-TARS-2 registra cerca de 53% no OSWorld-Verified).
Licenciamento. Pesos abertos (Apache-2.0 para checkpoints lançados — verifique por checkpoint). Preços. Pesos gratuitos; você paga pelas GPUs ou por um endpoint hospedado.
Ideal para. Organizações que precisam de uso de computador local (on-premise) sem que nenhum dado saia da empresa.
Limitações. Hospedar um modelo multimodal com latência utilizável exige um trabalho real de infraestrutura, e ele ainda permanece significativamente atrás dos modelos fechados de fronteira em termos de taxa de sucesso.

Automação de navegador de código aberto para fluxos de trabalho, voltada para processos de negócios repetíveis em vez de chat.
Como funciona. Combina modelos de visão com análise de DOM para concluir fluxos de trabalho na web e os expõe como objetos de fluxo de trabalho parametrizados e reutilizáveis com uma API — o que há de mais próximo no ecossistema aberto de "RPA, porém adaptável".
Limites de capacidade. Somente web, com bom suporte para formulários, logins, transferências de 2FA e downloads. Uma excelente opção para fluxos de seguros, compras e portais governamentais.
Licenciamento. Núcleo de código aberto (AGPL-3.0) com nuvem gerenciada paga. Preços. Gratuito para auto-hospedagem; nuvem cobrada por execução/etapa.
Ideal para. Equipes que estão substituindo suítes Selenium frágeis em processos web de alto volume.
Limitações. Escopo limitado ao navegador; a licença AGPL traz implicações caso você a incorpore em um produto comercial.
Um agente para celular e web que executa tarefas em aplicativos reais, com ampla cobertura do ecossistema chinês.
Como funciona. Um agente multimodal baseado em GLM que opera aplicativos Android e páginas da web por meio de ações na interface gráfica, oferecido como uma experiência de assistente e via API.
Limites de capacidade. Aplicativos móveis e web, incluindo cobertura profunda de superaplicativos chineses que agentes ocidentais não conseguem acessar.
Licenciamento. Produto fechado; partes da família de modelos GLM possuem pesos abertos. Preços. Níveis de consumidor e preços de API.
Ideal para. Equipes que operam no mercado chinês. Limitações. Relevância limitada para stacks de desktop ocidentais; a documentação é majoritariamente em chinês.
Um framework de pesquisa para controle geral de computadores, mais conhecido por operar softwares complexos apenas a partir de pixels.
Como funciona. Um ciclo de seis módulos — coleta de informações, autorreflexão, inferência de tarefas, curadoria de habilidades, planejamento de ações e memória — sobre capturas de tela, com o agente construindo uma biblioteca de habilidades reutilizáveis conforme avança.
Limites de capacidade. Jogos e softwares complexos como alvo de pesquisa; a ideia de curadoria de habilidades é a parte transferível.
Licenciamento. Código aberto (MIT). Preço. Gratuito; os custos do modelo são por sua conta.
Ideal para. Pesquisadores que estudam controle de longo prazo e reutilização de habilidades. Limitações. Não é um produto de automação empresarial — espere papéis, não documentos.

Uma camada de infraestrutura de código aberto que oferece aos agentes uma máquina virtual macOS ou Linux em ambiente isolado para operar.
Como funciona. VMs leves (usando o framework de Virtualização da Apple em Apple silicon) somadas a um SDK de agente, para que qualquer modelo possa ser direcionado a um computador descartável com estado limpo e reproduzível.
Limite de capacidade. É o substrato, não o cérebro — traga seu próprio modelo e política.
Licenciamento. Código aberto (MIT). Preços. Gratuito para auto-hospedagem; uma opção de contêiner na nuvem é oferecida.
Ideal para. Desenvolvedores que precisam de isolamento e reprodutibilidade para execuções de agentes, ou que desejam testar agentes com segurança.
Limitações. Você ainda precisa construir o agente; os recursos da VM macOS dependem de Apple silicon.
Automação de processos de código aberto que aprende a partir de demonstrações humanas gravadas de trabalho em interface gráfica.
Como funciona. Grava a tela, o mouse e o teclado enquanto uma pessoa realiza uma tarefa e, em seguida, usa grandes modelos multimodais para generalizar a gravação em um processo adaptável e reproduzível.
Limites de capacidade. Trabalho em interface gráfica de desktop que um humano pode demonstrar uma vez; explicitamente focado em privacidade, com limpeza local de dados sensíveis.
Licenciamento. Código aberto (MIT). Preço. Gratuito.
Ideal para. Equipes que preferem "mostrar, não pedir" e querem que tudo permaneça local.
Limitações. A generalização baseada em demonstração ainda é frágil em fluxos com muitas ramificações; comunidade menor do que a do Browser Use ou Skyvern.
Um engenheiro de software autônomo que trabalha em seu próprio ambiente de nuvem com editor, terminal e navegador.
Como funciona. A partir de um ticket, ele planeja, escreve código, executa testes, navega pela documentação e abre um pull request, trabalhando de forma assíncrona em um ambiente persistente que você pode inspecionar e assumir.
Limites de capacidade. Tarefas de engenharia de software e uso complementar da web. Não é um agente de automação de escritório geral.
Licenciamento. Fechado, hospedado. Preços. Cobrança baseada em uso (ACU) além de um plano de equipe; historicamente, um dos agentes mais caros por unidade de trabalho.
Ideal para. Organizações de engenharia que delegam tarefas de backlog bem definidas. Limitações. Custo e o padrão comum de alto desempenho em tarefas delimitadas e baixo desempenho em tarefas ambíguas.

Um navegador com IA cujo assistente pode interagir com as páginas que você está visualizando.
Como funciona. Um navegador baseado em Chromium com uma barra lateral inteligente integrada que lê o contexto da página e da aba atual e executa ações de várias etapas dentro do navegador usando suas sessões já logadas.
Limites de capacidade. Focado no navegador e moldado para o consumidor: comparação de compras, reservas, triagem de caixa de entrada e resumo do que está aberto.
Licenciamento. Fechado. Preços. Plano gratuito, com uso mais intenso de agentes vinculado aos planos pagos do Perplexity.
Ideal para. Indivíduos que desejam ajuda de agentes durante a navegação diária. Limitações. Não foi criado para processos de negócios autônomos e auditáveis; não funciona fora do navegador.

Um runtime de agente de código aberto desenvolvido em torno de modelos de pesos abertos, popular entre equipes que realizam auto-hospedagem.
Como funciona. Um loop de agente com chamada de ferramentas sobre a família de modelos Hermes, com ferramentas de navegador e shell disponíveis dependendo da configuração.
Limites de capacidade. Ampla, mas montada pelo desenvolvedor; destaca-se como uma opção totalmente auto-hospedada, sem dependência de fornecedores.
Licenciamento. Código aberto (MIT). Preços. Gratuito; os custos de infraestrutura e disponibilização de modelos são por sua conta.
Ideal para. Equipes com a exigência rigorosa de que nenhum dado saia de sua infraestrutura.
Limitações. Sem interface gerenciada, sem SLA de suporte e a qualidade da fundamentação da interface gráfica depende do modelo de visão que você utilizar.

Uma plataforma sem código para criar assistentes de IA que lidam com fluxos de trabalho empresariais recorrentes.
Como funciona. Agentes baseados em gatilhos conectados a centenas de integrações SaaS, com um construtor visual e uma ampla biblioteca de modelos; capacidade limitada de atuação no navegador sobreposta à camada de integração.
Limites de capacidade. Foco em integração — excelente onde existe um conector, limitado onde não existe.
Licenciamento. Fechado, hospedado. Preços. Plano gratuito com créditos mensais de tarefas; planos pagos escalam os créditos.
Ideal para. Operadores não técnicos automatizando e-mail, agendamento, higiene de CRM e acompanhamento de leads.
Limitações. Não é um verdadeiro agente de uso de computador: não possui desktop e a cobertura termina no catálogo de conectores.

Uma plataforma de automação de fluxo de trabalho de código aberto com nós de agentes de IA de primeira linha.
Como funciona. Um gráfico de nós que você constrói visualmente ou via código; os nós de agentes de IA chamam modelos e ferramentas, e os nós da comunidade adicionam controle de navegador (Playwright, Browser Use) quando necessário.
Limite de capacidade. Orquestração determinística com etapas agentivas opcionais — o inverso da ênfase de um agente de uso de computador.
Licenciamento. Código disponível sob a licença Sustainable Use (auto-hospedável, com restrições para revenda). Preços. Gratuito para auto-hospedagem; planos em nuvem cobrados por execução.
Ideal para. Equipes técnicas que desejam pipelines auditáveis e versionados, com julgamento de modelo apenas ocasional.
Limitações. Você cria cada etapa; nada se adapta a uma mudança na interface, a menos que você a faça.

Automação com agentes integrada ao maior catálogo de conexões do setor.
Como funciona. Agentes que utilizam as conexões de aplicativos do Zapier como ferramentas, acionados por eventos ou executados conforme um cronograma, com comportamento definido em linguagem natural.
Limites de capacidade. Qualquer coisa que possua um conector Zapier. Sem tela, sem desktop, sem raciocínio via interface gráfica (GUI).
Licenciamento. Fechado, hospedado. Preços. Plano gratuito com atividade de agente limitada; planos pagos baseados no volume de tarefas/atividades.
Ideal para. Organizações que já utilizam o Zapier e desejam um roteador mais inteligente entre aplicativos.
Limitações. Estritamente mediado por API — o oposto da cobertura que um agente de uso de computador oferece. Os custos aumentam rapidamente em alto volume.