
Un agent d'utilisation informatique est un système d'IA qui utilise un ordinateur comme le ferait une personne : il observe l'écran, déplace le curseur, clique, tape du texte, fait défiler des pages, change de fenêtre et lit le résultat avant de décider de la suite des opérations. Au lieu d'appeler une API mise à disposition par un fournisseur, il pilote l'interface existante.
Cette distinction est importante car la majeure partie du travail réel s'effectue encore derrière des interfaces dépourvues d'API : une console d'administration interne, un portail fournisseur, un client ERP de bureau, un CRM obsolèteou une feuille de calcul modifiée manuellement par trois équipes. L'agent d'utilisation informatique est la seule catégorie d'automatisation capable d'accéder à ces systèmes sans projet d'intégration.
Ce guide explique ce qu'est réellement cette catégorie, en quoi elle diffère de la RPA et des agents de navigation, ce que mesurent les benchmarks (et où ils peuvent induire en erreur), et présente 22 outils incontournables en 2026, avec pour chacun son approche, ses limites de capacité, ses conditions de licence, sa tarification, son profil d'utilisateur idéal et ses limites réelles.
Chaque agent d'utilisation informatique suit la même boucle :
L'ingénierie intéressante réside presque entièrement dans les étapes 2 et 4. La localisation est ce qui distingue un agent capable de cliquer sur la bonne cellule d'un tableur de celui qui clique 40 pixels à côté. La vérification est ce qui sépare un agent que l'on peut laisser travailler seul d'une simple démonstration qui ne fonctionne qu'une fois.
Trois benchmarks dominent les débats. Aucun ne correspond exactement à votre charge de travail, mais ensemble, ils permettent d'identifier les systèmes capables de boucler une tâche.

Un agent d'utilisation informatique qui s'exécute sur votre propre machine et fonctionne avec toutes vos applications, et pas seulement dans le navigateur.
Fonctionnement. Sai combine les données d'accessibilité du système d'exploitation avec l'analyse visuelle. Il peut ainsi interagir avec un bouton via son nœud d'accessibilité lorsqu'il est disponible, ou se baser sur les pixels dans le cas contraire. Il fonctionne sur une machine réelle — votre ordinateur portable ou un espace de travail cloud — ce qui signifie qu'il hérite de vos sessions connectées, de vos fichiers locaux et de votre réseau, sans vous demander de vous réauthentifier dans un environnement isolé.
Limites des capacités. Les flux de travail inter-applications sont au cœur de sa conception : extraire des enregistrements d'un CRM, les rapprocher d'un tableur, classer les exceptions dans un outil de gestion de tickets, envoyer le résumé par e-mail. Il gère les applications de bureau et les boîtes de dialogue de fichiers, pas seulement les pages web, et peut recevoir des instructions en langage naturel ou s'exécuter de manière autonome selon un calendrier ou un déclencheur.
Licence. Produit propriétaire. L'équipe publie également des recherches en open source dans cette catégorie (voir Agent S, ci-dessous).
Tarification. Offre gratuite avec un quota de temps d'utilisation limité ; plans payants pour un usage intensif ou automatisé. Consultez la page tarifaire actuelle avant d'établir votre budget.
Idéal pour : Les équipes opérationnelles, financières et GTM dont le travail s'étend sur plusieurs outils — dont au moins un ne dispose d'aucune API exploitable — et qui souhaitent que l'agent agisse en tant qu'utilisateur connecté plutôt que via un compte de service.
Limites. Il nécessite une machine pour fonctionner, ce n'est donc pas une API cloud sans infrastructure. Comme tout agent de cette catégorie, il est plus lent et plus coûteux par étape qu'un script codé en dur, et une tâche exécutée 10 000 fois par jour sur une interface stable sera toujours mieux gérée par une solution RPA ou une intégration directe.

L'agent hébergé par OpenAI qui navigue et utilise un ordinateur virtuel au sein de ChatGPT.
Fonctionnement. Une machine virtuelle hébergée dans le cloud dotée d'un navigateur, d'un terminal et d'outils de gestion de fichiers. L'agent analyse les captures d'écran et la structure des pages, et peut basculer entre un navigateur visuel et un navigateur textuel selon la tâche. Operator, la version de recherche précédente limitée au navigateur, a été intégrée à cet agent unifié.
Périmètre des capacités. Performant pour la recherche, le remplissage de formulaires et la création de documents (diapositives, feuilles de calcul) à partir du web. Il s'exécute dans le bac à sable d'OpenAI ; il n'a donc pas accès à votre bureau, à vos fichiers locaux ou à votre réseau interne, sauf si vous les téléchargez ou les connectez. Les actions sensibles nécessitent une confirmation.
Licence. Code fermé, hébergement uniquement. Tarification. Inclus dans les abonnements ChatGPT Plus / Pro / Business avec des quotas d'utilisation par niveau.
Idéal pour : Les particuliers et les équipes déjà habitués à ChatGPT qui ont besoin d'un agent pour des tâches web sans avoir à gérer d'infrastructure.
Limites. Aucun accès aux systèmes locaux ou sur site ; les sites qui bloquent les adresses IP des centres de données ou qui exigent votre propre session connectée constituent une contrainte récurrente ; il ne peut pas être auto-hébergé.

La fonctionnalité d'API qui a fait de l'« utilisation de l'ordinateur » une catégorie de produit : un modèle qui renvoie des actions de souris et de clavier à partir de captures d'écran.
Fonctionnement. Une boucle d'utilisation d'outils : vous envoyez Claude une capture d'écran accompagnée de la définition de l'outil, il renvoie une action (clic à des coordonnées précises, saisie, touche, défilement), votre environnement d'exécution l'exécute et renvoie la capture d'écran suivante. Anthropic fournit des images de conteneurs de référence ; la boucle elle-même est à votre charge. Claude pour Chrome applique le même principe au sein d'une extension de navigateur.
Limites des capacités. Tout ce que votre environnement d'exécution expose : un conteneur, une machine virtuelle ou un véritable bureau. Les modèles d'Anthropic sont actuellement en tête du classement OSWorld-Verified, la qualité de base du « grounding » est donc à la pointe de la technologie.
Licence. Modèle fermé, environnement d'exécution de référence ouvert. Tarification. Tarification standard par jetons (tokens) d'API ; l'utilisation de l'ordinateur est gourmande en jetons car chaque étape nécessite l'envoi d'une image.
Idéal pour. Les équipes d'ingénierie qui développent leur propre produit d'agent ou leur environnement d'exécution interne en s'appuyant sur le modèle de « grounding » le plus performant disponible.
Limites. Il s'agit d'une fonctionnalité, pas d'un produit fini : vous gérez le sandboxing, les tentatives de répétition, la vérification, les identifiants et la piste d'audit. Le coût par tâche accomplie est élevé par rapport aux outils limités au navigateur.

Un agent de codage natif pour terminal qui exploite un dépôt, un shell et, de plus en plus, un navigateur.
Fonctionnement. S'exécute dans votre terminal (ou IDE), lit et modifie des fichiers, lance des commandes et itère en fonction des résultats des tests. Ce n'est pas un agent avec interface graphique au sens strict, mais il figure sur cette liste car, pour les flux de travail des développeurs, il remplace ce qu'un agent d'utilisation informatique ferait lentement via une interface utilisateur.
Limites des capacités. Excellent pour le code, les systèmes de build, les migrations et tout ce qui peut être exprimé sous forme de fichiers et de commandes. Il peut piloter un navigateur pour les tests via des serveurs MCP, mais il n'est pas conçu pour naviguer dans un ERP.
Licence. Code propriétaire ; fourni avec les abonnements Claude et les clés API. Tarification. Inclus dans les niveaux Claude Pro/Max ou facturé à l'utilisation de l'API.
Idéal pour. Ingénieurs. Limites. Travail axé sur le développement uniquement ; les utilisateurs non techniques ne tireront aucun avantage d'une interface centrée sur le terminal.
La capacité d'agent de contrôle de navigateur de Google, exposée à la fois comme outil de modèle et comme prototype de recherche.
Fonctionnement. Une variante de modèle entraînée à émettre des actions de navigation (cliquer, taper, faire défiler, naviguer) à partir de captures d'écran et du contexte de la page, avec Mariner comme expérience côté Chrome qui exécute des tâches multi-onglets pour le compte de l'utilisateur.
Limites des capacités. Priorité au navigateur. Performant pour la navigation web et les formulaires ; non conçu pour les applications de bureau.
Licence. Propriétaire. Tarification. Accès au modèle facturé au jeton via l'API Gemini ; l'accès à Mariner est réservé aux niveaux d'abonnement IA supérieurs.
Idéal pour. Les équipes utilisant déjà Google Cloud / Gemini qui souhaitent un contrôle du navigateur au sein du même périmètre de facturation.
Limites. La disponibilité et la dénomination ont souvent changé — vérifiez le statut actuel avant de baser votre architecture dessus. Aucune portée sur les applications de bureau.

Un agent général hébergé qui planifie des tâches complexes et les exécute sur une machine virtuelle cloud.
Fonctionnement. Décomposition des tâches associée à une machine virtuelle isolée (sandbox) équipée d'un navigateur, d'un shell et d'un système de fichiers. Le processus est asynchrone : vous définissez un objectif et revenez une fois le livrable (rapport, site, feuille de calcul) terminé.
Limites des capacités. Recherche web étendue et production d'artefacts ; l'environnement isolé n'a aucune connexion avec vos systèmes internes.
Licence. Fermé, hébergé. Tarification. Abonnements basés sur des crédits ; les exécutions longues consomment rapidement les crédits.
Idéal pour. Les travaux de recherche et de production de livrables où le résultat est un document, et non une modification au sein de vos systèmes.
Limites. La consommation de crédits est difficile à prévoir ; aucun accès aux logiciels locaux ou sur site ; vous confiez à une machine virtuelle tierce toutes les informations d'identification que vous y saisissez.
La bibliothèque open source la plus largement adoptée pour permettre à un LLM de piloter un navigateur.
Fonctionnement. Utilise Playwright en arrière-plan, avec une page simplifiée en une liste indexée d'éléments interactifs que le modèle sélectionne par numéro — bien plus économique et fiable qu'une analyse brute des pixels.
Limites des capacités. Tout ce qui se trouve dans Chromium. Une option cloud hébergée existe pour les équipes qui ne souhaitent pas l'exécuter elles-mêmes.
Licence. Open source (MIT). Tarification. Gratuit en auto-hébergement ; offre cloud facturée à l'usage. Les jetons du modèle sont à votre charge.
Idéal pour : Les développeurs créant des outils d'automatisation web qui recherchent un contrôle total et une large communauté.
Limites. Limité au navigateur par définition ; vous devez gérer la couche de fiabilité (tentatives, vérification, secrets) ; la qualité dépend fortement du modèle utilisé.
Un agent open source qui écrit et exécute du code localement pour accomplir des tâches, avec un mode OS pour le contrôle de l'interface graphique.
Fonctionnement. Le modèle génère du code Python, shell ou JavaScript, votre machine l'exécute et le résultat est renvoyé dans la boucle. Un mode OS optionnel permet de contrôler la souris et le clavier via des captures d'écran.
Domaine de compétence. Très étendu pour tout ce qui est scriptable : manipulation de fichiers, conversion de données, administration système. Le contrôle de l'interface graphique existe mais est moins mature que les solutions dédiées.
Licence. Open source (AGPL-3.0). Tarification. Gratuit ; vous payez les coûts liés au modèle.
Idéal pour : Les utilisateurs techniques souhaitant un agent local, agnostique vis-à-vis du modèle, avec un accès réel à la machine.
Limites. L'exécution de code généré par un modèle sur votre propre machine représente un risque réel : utilisez un environnement isolé (sandbox). La précision en mode interface graphique est en retrait par rapport aux leaders du secteur.
Un framework open-source compact qui permet aux modèles multimodaux de piloter un ordinateur via des captures d'écran.
Fonctionnement. Capture d'écran → modèle → action souris/clavier, avec des backends interchangeables (GPT, Gemini, Claude ou modèles de vision locaux).
Limites des capacités. Davantage une implémentation de référence et un outil pédagogique qu'un système de production.
Licence. Open source (MIT). Tarification. Gratuit ; les coûts liés aux modèles sont à votre charge.
Idéal pour. Comprendre le fonctionnement de la boucle ou amorcer un prototype. Limitations. Le clic basé sur les coordonnées est fragile ; peu de mécanismes de vérification, de récupération ou de gestion des identifiants.

Un framework agentique open source dédié à l'utilisation informatique, et l'une des architectures de référence dans la littérature scientifique.
Fonctionnement. Une conception modulaire : un planificateur, une mémoire augmentée par l'expérience qui réutilise les leçons des exécutions précédentes, et un module de mise en correspondance qui traduit les intentions en coordonnées précises. Les versions ultérieures décomposent le problème en modules spécialisés plutôt que de demander à un seul modèle de tout gérer.
Limites des capacités. Bureau complet, évalué sur OSWorld, WindowsAgentArena et AndroidWorld.
Licence. Open source. Tarification. Gratuit ; les coûts liés aux modèles sont à votre charge.
Idéal pour. Les chercheurs et ingénieurs qui souhaitent s'appuyer sur une base de référence solide et publiée plutôt que sur une boîte noire.
Limites. Il s'agit d'un framework, pas d'un produit : aucune interface utilisateur, aucun contrat de support, et vous devez assembler vous-même l'infrastructure opérationnelle.

Un modèle d'agent GUI natif à poids ouverts — la principale alternative ouverte aux modèles de mise en correspondance fermés.
Fonctionnement. Un modèle vision-langage unique entraîné de bout en bout sur la perception, le repérage et l'action au sein d'une interface graphique, plutôt qu'un pipeline orchestré par des prompts. Livré avec UI-TARS-desktop, une application qui l'exécute directement sur votre écran.
Limites des capacités. Contrôle d'interfaces graphiques sur ordinateur et mobile ; les meilleurs résultats parmi les modèles à poids ouverts sur les benchmarks de type OSWorld (UI-TARS-2 atteint environ 53 % sur OSWorld-Verified).
Licence. Poids ouverts (Apache-2.0 pour les points de contrôle publiés — à vérifier par point de contrôle). Tarification. Poids gratuits ; vous payez pour les GPU ou un point de terminaison hébergé.
Idéal pour. Les organisations ayant besoin d'une utilisation informatique sur site sans qu'aucune donnée ne quitte leurs locaux.
Limites. L'auto-hébergement d'un modèle multimodal avec une latence acceptable représente un véritable travail d'infrastructure, et ses taux de réussite restent nettement inférieurs à ceux des modèles fermés de pointe.

Automatisation de navigateur open-source pour les flux de travail, axée sur les processus métier répétables plutôt que sur la discussion.
Fonctionnement. Combine des modèles de vision avec l'analyse du DOM pour accomplir des flux de travail web, et les expose sous forme d'objets de flux de travail paramétrables et réutilisables via une API — ce qui se rapproche le plus de la « RPA, mais adaptative » dans l'écosystème open-source.
Limites des capacités. Web uniquement, avec une bonne prise en charge des formulaires, des connexions, des transferts 2FA et des téléchargements. Particulièrement adapté aux flux liés aux assurances, aux achats et aux portails gouvernementaux.
Licence. Cœur open source (AGPL-3.0) avec une offre cloud gérée payante. Tarification. Gratuit en auto-hébergement ; facturation à l'exécution/étape pour le cloud.
Idéal pour. Les équipes qui remplacent des suites Selenium fragiles par des processus web à haut volume.
Limites. Limité au navigateur ; la licence AGPL implique des contraintes si vous l'intégrez dans un produit commercial.
Un agent pour téléphone et web qui exécute des tâches dans des applications réelles, avec une excellente couverture de l'écosystème chinois.
Fonctionnement. Un agent multimodal basé sur GLM qui pilote des applications Android et des pages web via des actions sur l'interface graphique, proposé sous forme d'assistant et via API.
Périmètre fonctionnel. Applications mobiles et web, incluant une couverture approfondie des super-apps chinoises inaccessibles aux agents occidentaux.
Licence. Produit fermé ; certaines parties de la famille de modèles GLM sont à poids ouverts. Tarification. Niveaux grand public et tarification API.
Idéal pour. Les équipes opérant sur le marché chinois. Limites. Pertinence limitée pour les environnements de bureau occidentaux ; documentation principalement en chinois.
Un cadre de recherche pour le contrôle informatique général, reconnu pour sa capacité à manipuler des logiciels complexes à partir de simples pixels.
Fonctionnement. Une boucle à six modules — collecte d'informations, autoréflexion, déduction de tâches, sélection de compétences, planification d'actions et mémoire — basée sur des captures d'écran, l'agent constituant une bibliothèque de compétences réutilisables au fil de l'eau.
Limites des capacités. Jeux et logiciels complexes comme sujet de recherche ; le concept de sélection de compétences est l'élément transférable.
Licence. Open source (MIT). Tarification. Gratuit ; les coûts liés aux modèles sont à votre charge.
Idéal pour. Les chercheurs étudiant le contrôle à long terme et la réutilisation des compétences. Limites. Ce n'est pas un produit d'automatisation métier : attendez-vous à manipuler des fichiers, pas des documents.

Une couche d'infrastructure open source qui fournit aux agents une machine virtuelle macOS ou Linux isolée pour fonctionner.
Fonctionnement. Des machines virtuelles légères (utilisant le framework de virtualisation d'Apple sur Apple Silicon) combinées à un SDK pour agents, permettant de diriger n'importe quel modèle vers un ordinateur éphémère à l'état propre et reproductible.
Limites des capacités. Il s'agit du substrat, pas du cerveau : apportez votre propre modèle et vos propres règles.
Licence. Open source (MIT). Tarification. Gratuit en auto-hébergement ; une option de conteneur cloud est proposée.
Idéal pour. Les développeurs ayant besoin d'isolation et de reproductibilité pour l'exécution de leurs agents, ou souhaitant tester leurs agents en toute sécurité.
Limites. Vous devez toujours concevoir l'agent ; les fonctionnalités des machines virtuelles macOS dépendent de l'architecture Apple Silicon.
Automatisation de processus open source qui apprend à partir d'enregistrements de tâches effectuées par des humains sur une interface graphique.
Fonctionnement. Enregistre l'écran, la souris et le clavier pendant qu'une personne effectue une tâche, puis utilise de grands modèles multimodaux pour généraliser l'enregistrement en un processus adaptatif et reproductible.
Domaine d'application. Tâches sur interface graphique de bureau qu'un humain peut démontrer une fois ; approche explicitement axée sur la confidentialité, avec nettoyage local des données sensibles.
Licence. Open source (MIT). Tarification. Gratuit.
Idéal pour. Les équipes qui préfèrent « montrer plutôt que demander » et qui souhaitent que tout reste en local.
Limites. La généralisation basée sur la démonstration reste fragile pour les flux très ramifiés ; communauté plus restreinte que celles de Browser Use ou Skyvern.
Un ingénieur logiciel autonome qui travaille dans son propre environnement cloud avec un éditeur, un terminal et un navigateur.
Fonctionnement. À partir d'un ticket, il planifie, écrit le code, exécute les tests, consulte la documentation et ouvre une pull request, le tout de manière asynchrone dans un espace de travail persistant que vous pouvez inspecter et reprendre en main.
Périmètre des capacités. Tâches de génie logiciel et navigation web associée. Il ne s'agit pas d'un agent d'automatisation de bureau généraliste.
Licence. Fermée, hébergée. Tarification. Facturation à l'usage (ACU) en complément d'un forfait équipe ; historiquement l'un des agents les plus coûteux par unité de travail.
Idéal pour. Les équipes d'ingénierie souhaitant déléguer des tâches de backlog bien définies. Limites. Le coût, ainsi que le schéma classique de performances solides sur des tâches ciblées et plus faibles sur des tâches ambiguës.

Un navigateur IA dont l'assistant peut interagir avec les pages que vous consultez.
Fonctionnement. Un navigateur basé sur Chromium doté d'une barre latérale intelligente intégrée qui lit le contexte de la page et de l'onglet actuels, et exécute des actions en plusieurs étapes au sein du navigateur en utilisant vos sessions déjà connectées.
Périmètre des capacités. Orienté navigateur et grand public : comparateur d'achats, réservations, tri de boîte de réception, synthèse des onglets ouverts.
Licence. Fermé. Tarification. Offre gratuite, avec des fonctionnalités d'agent avancées liées aux abonnements payants Perplexity.
Idéal pour. Les particuliers souhaitant une assistance automatisée lors de leur navigation quotidienne. Limites. Non conçu pour des processus métier automatisés et auditables ; limité au navigateur uniquement.

Un agent open source dont l'environnement d'exécution repose sur des modèles à poids ouverts, très prisé des équipes pratiquant l'auto-hébergement.
Fonctionnement. Une boucle d'agent capable d'appeler des outils via la famille de modèles Hermes, avec accès au navigateur et au terminal selon la configuration.
Périmètre des capacités. Étendu mais assemblé par les développeurs ; particulièrement efficace en tant qu'option entièrement auto-hébergée sans dépendance vis-à-vis d'un fournisseur.
Licence. Open source (MIT). Tarification. Gratuit ; les coûts d'infrastructure et d'hébergement des modèles sont à votre charge.
Idéal pour. Les équipes ayant l'exigence stricte que rien ne quitte leur infrastructure.
Limites. Pas d'interface utilisateur gérée, pas de SLA de support, et la qualité de l'ancrage de l'interface graphique dépend du modèle de vision que vous utilisez.

Une plateforme sans code pour créer des assistants IA qui gèrent les flux de travail métier récurrents.
Fonctionnement. Des agents basés sur des déclencheurs connectés à des centaines d' intégrations SaaS, avec un constructeur visuel et une vaste bibliothèque de modèles ; une capacité limitée d'interaction avec le navigateur s'ajoute à la couche d'intégration.
Limites des capacités. Axé sur les intégrations — excellent lorsqu'un connecteur existe, limité dans le cas contraire.
Licence. Fermée, hébergée. Tarification. Offre gratuite avec des crédits de tâches mensuels ; les plans payants augmentent le nombre de crédits.
Idéal pour. Opérateurs non techniques automatisant les e-mails, la planification, l'hygiène du CRM et le suivi des leads.
Limites. Pas un véritable agent d'utilisation informatique : pas de bureau, et la couverture s'arrête au catalogue de connecteurs.

Une plateforme d'automatisation de flux de travail open-source avec des nœuds d'agents IA de premier ordre.
Fonctionnement. Un graphe de nœuds que vous construisez visuellement ou par code ; les nœuds d'agents IA appellent des modèles et des outils, et les nœuds communautaires ajoutent un contrôle du navigateur (Playwright, Browser Use) si nécessaire.
Limites des capacités. Orchestration déterministe avec des étapes agentiques optionnelles — l'inverse de l'approche d'un agent d'utilisation informatique.
Licence. Source disponible sous la licence Sustainable Use (auto-hébergeable, avec des restrictions sur la revente). Tarification. Gratuit en auto-hébergement ; plans cloud facturés à l'exécution.
Idéal pour. Les équipes techniques qui souhaitent des pipelines auditables et versionnés, avec seulement un recours occasionnel au jugement d'un modèle.
Limites. Vous créez chaque étape ; rien ne s'adapte à un changement d'interface à moins que vous ne le fassiez vous-même.

Automatisation par agents intégrée au plus vaste catalogue d'intégrations du secteur.
Fonctionnement. Des agents qui utilisent les connexions aux applications de Zapier comme outils, déclenchés par des événements ou planifiés, avec un comportement défini en langage naturel.
Limites des capacités. Tout ce qui dispose d'un connecteur Zapier. Pas d'écran, pas de bureau, pas de raisonnement basé sur une interface graphique.
Licence. Fermée, hébergée. Tarification. Offre gratuite avec une activité d'agent limitée ; forfaits payants basés sur le volume de tâches ou d'activités.
Idéal pour. Les entreprises utilisant déjà Zapier et souhaitant un routeur plus intelligent entre leurs applications.
Limites. Strictement limité aux API — l'exact opposé de la couverture offerte par un agent capable d'utiliser un ordinateur. Les coûts augmentent rapidement avec le volume.