
Ein Computer-Nutzungs-Agent ist ein KI-System, das einen Computer so bedient wie ein Mensch: Es betrachtet den Bildschirm, bewegt den Mauszeiger, klickt, tippt, scrollt, wechselt zwischen Fenstern und liest das Ergebnis, bevor es entscheidet, was als Nächstes zu tun ist. Anstatt eine API aufzurufen, die ein Anbieter zufällig bereitgestellt hat, steuert es die bereits vorhandene Benutzeroberfläche.
Dieser Unterschied ist wichtig, da die meiste echte Arbeit immer noch hinter Oberflächen ohne API stattfindet: eine interne Admin-Konsole, ein Lieferantenportal, ein Desktop-ERP-Client, ein Legacy-CRModer eine Tabellenkalkulation, die von drei Teams manuell bearbeitet wird. Ein Computer-Nutzungs-Agent ist die einzige Automatisierungskategorie, die diese Systeme ohne Integrationsprojekt erreicht.
Dieser Leitfaden erläutert, was diese Kategorie eigentlich ist, wie sie sich von RPA und Browser-Agenten unterscheidet, was die Benchmarks messen (und wo sie in die Irre führen) sowie 22 Tools, die man 2026 kennen sollte – jeweils mit ihrem zugrunde liegenden Ansatz, ihren Funktionsgrenzen, Lizenzierung, Preisgestaltung, idealen Anwendern und ehrlichen Einschränkungen.
Jeder Computer-Nutzungs-Agent durchläuft denselben Kreislauf:
Die eigentliche technische Herausforderung liegt fast ausschließlich in den Schritten 2 und 4. Die Zuordnung unterscheidet einen Agenten, der die richtige Zelle in einer Tabelle trifft, von einem, der 40 Pixel daneben klickt. Die Überprüfung unterscheidet einen Agenten, den man unbeaufsichtigt laufen lassen kann, von einer Demo, die nur einmal gut aussieht.
Drei Benchmarks dominieren die Diskussion. Keiner davon entspricht exakt Ihrem Workload, aber zusammen zeigen sie Ihnen, welche Systeme tatsächlich in der Lage sind, einen Prozess vollständig abzuschließen.

Ein Computer-Use-Agent, der auf Ihrem eigenen Rechner läuft und über alle Anwendungen hinweg funktioniert – nicht nur im Browser.
Funktionsweise. Sai kombiniert Barrierefreiheitsdaten auf Betriebssystemebene mit visueller Erkennung. So kann das System Schaltflächen über deren Accessibility-Knoten ansteuern, wenn diese vorhanden sind, und andernfalls auf die Pixel-Ebene zurückgreifen. Da es auf einem echten Rechner läuft – Ihrem Laptop oder einem Cloud-Arbeitsplatz –, übernimmt es Ihre bestehenden Anmeldesitzungen, lokalen Dateien und Netzwerkeinstellungen, anstatt Sie zur erneuten Authentifizierung in einer Sandbox aufzufordern.
Leistungsumfang. Übergreifende Workflows stehen im Mittelpunkt: Datensätze aus einem CRM abrufen, mit einer Tabelle abgleichen, Ausnahmen in einem Ticket-System erfassen und die Zusammenfassung per E-Mail versenden. Es verarbeitet Desktop-Anwendungen und Dateidialoge, nicht nur Webseiten, und kann Aufgaben in natürlicher Sprache entgegennehmen oder unbeaufsichtigt nach Zeitplan oder Auslöser ausgeführt werden.
Lizenzierung. Proprietäres Produkt. Das Team veröffentlicht zudem offene Forschungsergebnisse in diesem Bereich (siehe Agent S weiter unten).
Preise. Kostenlose Basisversion mit begrenztem Kontingent an Rechenzeit; kostenpflichtige Pläne für intensivere und unbeaufsichtigte Nutzung. Prüfen Sie die aktuelle Preisseite, bevor Sie Ihr Budget planen.
Ideal für. Teams in den Bereichen Operations, Finanzen und GTM, deren Arbeit sich über mehrere Tools erstreckt – von denen mindestens eines keine nutzbare API besitzt – und die möchten, dass der Agent als ihr eigener, angemeldeter Benutzer agiert und nicht über ein Dienstkonto.
Einschränkungen. Da er eine Maschine zur Steuerung benötigt, handelt es sich nicht um eine Cloud-API ohne eigenen Ressourcenbedarf. Wie jeder Agent dieser Kategorie ist er pro Schritt langsamer und kostspieliger als ein fest programmiertes Skript. Aufgaben, die 10.000 Mal am Tag auf einer stabilen Benutzeroberfläche ausgeführt werden, sind nach wie vor besser durch RPA oder eine direkte Integration abgedeckt.

Der gehostete Agent von OpenAI, der innerhalb von ChatGPT einen virtuellen Computer durchsucht und bedient.
Funktionsweise. Eine in der Cloud gehostete virtuelle Maschine mit Browser, Terminal und Dateiverwaltung. Der Agent analysiert Screenshots sowie die Seitenstruktur und kann je nach Aufgabe zwischen einem visuellen Browser und einem Text-Browser wechseln. Operator, die frühere, reine Browser-Forschungsvorschau, wurde in diesen einheitlichen Agenten integriert.
Leistungsumfang. Stark bei Recherchen, dem Ausfüllen von Formularen und der Erstellung von Dokumenten (Folien, Tabellen) aus Web-Aktivitäten. Da er in der Sandbox von OpenAI läuft, hat er keinen Zugriff auf Ihren Desktop, Ihre lokalen Dateien oder Ihr internes Netzwerk, es sei denn, Sie laden diese hoch oder verbinden sie. Sensible Aktionen erfordern eine Bestätigung.
Lizenzierung. Proprietär, nur als gehosteter Dienst verfügbar. Preise. In den ChatGPT Plus-, Pro- und Business-Tarifen mit stufenabhängigen Nutzungskontingenten enthalten.
Ideal für. Einzelpersonen und Teams, die bereits auf ChatGPT setzen und agentenbasierte Aufgaben im Web erledigen müssen, ohne sich um die Infrastruktur kümmern zu wollen.
Einschränkungen. Kein Zugriff auf lokale oder On-Premise-Systeme; Websites, die Rechenzentrums-IPs blockieren oder eine eigene, angemeldete Sitzung erfordern, stellen ein wiederkehrendes Hindernis dar; eine Selbst-Hosting-Option ist nicht verfügbar.

Die API-Funktion, die „Computer Use“ zu einer Produktkategorie gemacht hat – ein Modell, das Maus- und Tastaturaktionen anhand von Screenshots ausführt.
Funktionsweise. Eine Tool-Use-Schleife: Sie senden Claude einen Screenshot sowie die Tool-Definition; das Modell gibt eine Aktion zurück (Klick auf Koordinaten, Eingabe, Tastendruck, Scrollen), Ihr System führt diese aus und sendet den nächsten Screenshot zurück. Anthropic stellt Referenz-Container-Images bereit; die Schleife selbst müssen Sie jedoch selbst betreiben. Claude für Chrome wendet dasselbe Prinzip innerhalb einer Browser-Erweiterung an.
Funktionsumfang. Alles, was Ihr System bereitstellt – ein Container, eine VM oder ein echter Desktop. Die Modelle von Anthropic führen derzeit die OSWorld-Verified-Bestenliste an, die Qualität der direkten Interaktion ist also auf dem neuesten Stand der Technik.
Lizenzierung. Geschlossenes Modell, offenes Referenz-Framework. Preise. Standard-API-Token-Preise; Computer Use ist sehr tokenintensiv, da bei jedem Schritt ein Bild übertragen wird.
Ideal für. Engineering-Teams, die ihr eigenes Agenten-Produkt oder ein internes Framework auf Basis des leistungsfähigsten verfügbaren Modells für die Interaktion mit Benutzeroberflächen entwickeln.
Einschränkungen. Es handelt sich um eine Funktion, nicht um ein fertiges Produkt – Sie sind selbst für Sandboxing, Wiederholungsversuche, Verifizierung, Anmeldedaten und Protokollierung verantwortlich. Die Kosten pro abgeschlossener Aufgabe sind im Vergleich zu browserbasierten Tools hoch.

Ein Terminal-nativer Coding-Agent das ein Repository, eine Shell und zunehmend auch einen Browser bedient.
Funktionsweise. Läuft in Ihrem Terminal (oder Ihrer IDE), liest und bearbeitet Dateien, führt Befehle aus und iteriert basierend auf Testergebnissen. Es ist kein GUI-Agent im strengen Sinne, gehört aber auf diese Liste, da es für Entwickler-Workflows Aufgaben übernimmt, die ein Computer-Use-Agent sonst langsam über eine Benutzeroberfläche erledigen würde.
Funktionsumfang. Hervorragend geeignet für Code, Build-Systeme, Migrationen und alles, was sich über Dateien und Befehle abbilden lässt. Es kann über MCP-Server einen Browser für Tests steuern, ist jedoch nicht darauf ausgelegt, sich durch ein ERP-System zu klicken.
Lizenzierung. Proprietär; verfügbar über Claude-Abonnements und API-Schlüssel. Preise. In den Claude Pro/Max-Tarifen enthalten oder über die API-Nutzung abgerechnet.
Ideal für. Entwickler. Einschränkungen. Nur für entwicklerorientierte Aufgaben; für technisch nicht versierte Anwender bietet eine terminalbasierte Schnittstelle keinen Mehrwert.
Googles browsergesteuerter Agent mit Funktionen, die sowohl als Modell-Tool als auch als Forschungsprototyp bereitgestellt werden.
Funktionsweise. Eine Modellvariante, die darauf trainiert wurde, Browser-Aktionen (Klicken, Tippen, Scrollen, Navigieren) basierend auf Screenshots und Seitenkontext auszuführen, wobei Mariner als Chrome-Erweiterung fungiert, die Multi-Tab-Aufgaben im Auftrag des Benutzers ausführt.
Funktionsumfang. Browser-fokussiert. Stärken bei Web-Navigation und Formularen; nicht für Desktop-Anwendungen ausgelegt.
Lizenzierung. Proprietär. Preismodell. Der Modellzugriff wird pro Token über die Gemini-API abgerechnet; der Zugriff auf Mariner ist an höhere KI-Abonnementstufen gebunden.
Ideal für. Teams, die bereits Google Cloud / Gemini nutzen und Browser-Steuerung innerhalb desselben Abrechnungsrahmens benötigen.
Einschränkungen. Verfügbarkeit und Bezeichnungen haben sich mehrfach geändert – prüfen Sie den aktuellen Status, bevor Sie darauf aufbauen. Kein Desktop-Support.

Ein gehosteter General-Purpose-Agent, der komplexe Aufgaben plant und auf einer virtuellen Cloud-Maschine ausführt.
Funktionsweise. Aufgabenzerlegung kombiniert mit einer isolierten VM inklusive Browser, Shell und Dateisystem. Es arbeitet asynchron – Sie geben ein Ziel vor und erhalten später ein Ergebnis (einen Bericht, eine Website, eine Tabelle).
Funktionsumfang. Umfassende Web-Recherche und Erstellung von Arbeitsergebnissen; die Sandbox hat keine Verbindung zu Ihren internen Systemen.
Lizenzierung. Geschlossen, gehostet. Preise. Kreditbasierte Abonnementstufen; lange Ausführungen verbrauchen Credits schnell.
Am besten geeignet für. Recherche- und Ergebnisarbeit, bei der das Resultat ein Dokument ist und keine Änderung innerhalb Ihrer Systeme.
Einschränkungen. Der Kreditverbrauch ist schwer vorhersehbar; kein Zugriff auf lokale oder On-Premise-Software; Sie vertrauen einer virtuellen Maschine eines Drittanbieters alle Anmeldedaten an, die Sie dort eingeben.
Die am weitesten verbreitete Open-Source-Bibliothek um ein LLM einen Browser steuern zu lassen.
Funktionsweise. Basiert auf Playwright, wobei die Seite in eine indizierte Liste interaktiver Elemente umgewandelt wird, die das Modell per Nummer auswählt – weitaus kostengünstiger und zuverlässiger als die reine pixelbasierte Steuerung.
Funktionsumfang. Alles innerhalb von Chromium. Eine gehostete Cloud-Option ist für Teams verfügbar, die es nicht selbst betreiben möchten.
Lizenzierung. Open Source (MIT). Preise. Kostenlos bei Selbst-Hosting; Cloud-Tarif nutzungsabhängig. Die Kosten für Modell-Token tragen Sie selbst.
Ideal für: Entwickler, die Web-Automatisierung erstellen und dabei volle Kontrolle sowie eine große Community wünschen.
Einschränkungen: Definitionsgemäß nur für Browser; Sie müssen die Zuverlässigkeitsebene (Wiederholungsversuche, Verifizierung, Geheimnisse) selbst bereitstellen; die Qualität hängt stark vom verwendeten Modell ab.
Ein Open-Source-Agent, der Code lokal schreibt und ausführt, um Aufgaben zu erledigen, inklusive eines OS-Modus für die GUI-Steuerung.
Funktionsweise: Das Modell generiert Python-, Shell- oder JavaScript-Code, Ihr Rechner führt diesen aus und die Ausgabe fließt zurück in die Schleife. Ein optionaler OS-Modus ermöglicht die Steuerung von Maus und Tastatur mittels Screenshots.
Leistungsumfang: Sehr breit gefächert bei allem, was skriptbar ist – Dateiverwaltung, Datenkonvertierung, Systemadministration. Die GUI-Steuerung ist vorhanden, aber weniger ausgereift als bei spezialisierten Lösungen.
Lizenzierung: Open Source (AGPL-3.0). Preise: Kostenlos; Sie zahlen lediglich die Modellkosten.
Ideal für: Technische Anwender, die einen lokalen, modellunabhängigen Agenten mit direktem Zugriff auf das Betriebssystem suchen.
Einschränkungen: Das Ausführen von KI-generiertem Code auf dem eigenen Rechner birgt echte Sicherheitsrisiken – nutzen Sie eine Sandbox. Die Genauigkeit im GUI-Modus liegt hinter den Marktführern zurück.
Ein kompaktes Open-Source-Framework, das es multimodalen Modellen ermöglicht, einen Computer per Screenshot zu bedienen.
Funktionsweise. Screenshot → Modell → Maus-/Tastaturaktion, mit austauschbaren Backends (GPT-Klasse, Gemini, Claude oder lokale Vision-Modelle).
Leistungsgrenzen. Eher eine Referenzimplementierung und ein Lehrmittel als ein produktives System.
Lizenzierung. Open Source (MIT). Preise. Kostenlos; die Modellkosten tragen Sie selbst.
Ideal für. Das Verständnis der Funktionsweise solcher Abläufe oder den schnellen Aufbau eines Prototyps. Einschränkungen. Koordinatenbasiertes Klicken ist fehleranfällig; es gibt kaum Mechanismen zur Überprüfung, Fehlerbehebung oder Verwaltung von Zugangsdaten.

Ein Open-Source-Agenten-Framework für die Computernutzung und eine der Referenzarchitekturen in der Forschungsliteratur.
Funktionsweise. Modular aufgebaut: mit einem Planer, einem erfahrungsbasierten Speicher, der Erkenntnisse aus früheren Durchläufen wiederverwendet, und einem Grounding-Modul, das Absichten in präzise Koordinaten übersetzt. Neuere Versionen zerlegen das Problem in spezialisierte Module, anstatt alles von einem einzigen Modell erledigen zu lassen.
Leistungsumfang. Vollständiger Desktop-Support, getestet auf OSWorld, WindowsAgentArena und AndroidWorld.
Lizenzierung. Open Source. Preise. Kostenlos; die Modellkosten tragen Sie selbst.
Ideal für. Forscher und Entwickler, die eine fundierte, veröffentlichte Basis suchen, auf der sie aufbauen können, anstatt eine Blackbox zu nutzen.
Einschränkungen. Ein Framework, kein Produkt – keine Benutzeroberfläche, kein Support-Vertrag; die operative Infrastruktur müssen Sie selbst zusammenstellen.

Ein natives GUI-Agentenmodell mit offenen Gewichten – die führende offene Alternative zu geschlossenen Grounding-Modellen.
Funktionsweise. Ein einzelnes Vision-Language-Modell, das durchgängig für GUI-Wahrnehmung, Grounding und Interaktion trainiert wurde, statt einer durch Prompts gesteuerten Pipeline. Wird zusammen mit UI-TARS-desktop ausgeliefert, einer Anwendung, die das Modell direkt auf Ihrem Bildschirm ausführt.
Leistungsumfang. Steuerung von Desktop- und mobilen GUIs; die stärksten Open-Weight-Ergebnisse bei Benchmarks auf OSWorld-Niveau (UI-TARS-2 erreicht etwa 53 % bei OSWorld-Verified).
Lizenzierung. Open Weights (Apache-2.0 für veröffentlichte Checkpoints – bitte pro Checkpoint prüfen). Preise. Kostenlose Modellgewichte; Sie zahlen lediglich für die GPUs oder einen gehosteten Endpunkt.
Ideal für. Unternehmen, die eine lokale Computer-Nutzung benötigen, bei der keine Daten das Haus verlassen.
Einschränkungen. Das Self-Hosting eines multimodalen Modells mit praxistauglicher Latenz erfordert echten Infrastrukturaufwand und liegt bei der Erfolgsquote noch deutlich hinter den führenden Closed-Source-Modellen zurück.

Open-Source-Browser-Automatisierung für Workflows, die auf wiederholbare Geschäftsprozesse statt auf Chat-Interaktionen ausgelegt sind.
Funktionsweise. Kombiniert Vision-Modelle mit DOM-Parsing zur Ausführung von Web-Workflows und stellt diese als parametrisierte, wiederholbare Workflow-Objekte mit API bereit – das Äquivalent zu „RPA, aber adaptiv“ im Open-Source-Ökosystem.
Leistungsumfang. Nur Web, mit guter Unterstützung für Formulare, Logins, 2FA-Übergaben und Downloads. Besonders geeignet für Abläufe in den Bereichen Versicherung, Beschaffung und Behördenportale.
Lizenzierung. Open-Source-Kern (AGPL-3.0) mit kostenpflichtiger Managed-Cloud-Option. Preise. Kostenlos bei Selbst-Hosting; Cloud-Abrechnung pro Durchlauf/Schritt.
Ideal für. Teams, die fehleranfällige Selenium-Suites bei hochvolumigen Webprozessen ersetzen möchten.
Einschränkungen. Browser-basiert; die AGPL hat Auswirkungen, wenn Sie es in ein kommerzielles Produkt einbetten.
Ein Telefon- und Web-Agent , der Aufgaben in echten Apps ausführt und eine starke Abdeckung des chinesischen Ökosystems bietet.
Funktionsweise. Ein auf GLM basierender multimodaler Agent, der Android-Apps und Webseiten durch GUI-Aktionen steuert und sowohl als Assistenz-Erfahrung als auch per API angeboten wird.
Leistungsumfang. Mobile Apps und Web, einschließlich umfassender Unterstützung chinesischer Super-Apps, die für westliche Agenten nicht zugänglich sind.
Lizenzierung. Geschlossenes Produkt; Teile der GLM-Modellfamilie sind mit offenen Gewichten verfügbar. Preise. Verbrauchertarife und API-Preise.
Ideal für. Teams, die auf dem chinesischen Markt tätig sind. Einschränkungen. Begrenzte Relevanz für westliche Desktop-Umgebungen; die Dokumentation ist primär auf Chinesisch verfasst.
Ein Forschungs-Framework zur allgemeinen Computersteuerung, bekannt dafür, komplexe Software allein anhand von Pixeldaten zu bedienen.
Funktionsweise. Ein Sechs-Modul-Kreislauf – Informationsbeschaffung, Selbstreflexion, Aufgabenableitung, Skill-Kuration, Aktionsplanung und Gedächtnis – basierend auf Screenshots, wobei der Agent während des Prozesses eine wiederverwendbare Skill-Bibliothek aufbaut.
Leistungsgrenzen. Spiele und komplexe Software als Forschungsgegenstand; der Ansatz der Skill-Kuration ist dabei der übertragbare Teil.
Lizenzierung. Open Source (MIT). Preise. Kostenlos; die Modellkosten tragen Sie selbst.
Ideal für. Forscher, die sich mit langfristiger Steuerung und der Wiederverwendung von Fähigkeiten befassen. Einschränkungen. Kein Business-Automatisierungsprodukt – erwarten Sie Skripte, keine Dokumente.

Eine Open-Source-Infrastrukturebene, die Agenten eine isolierte macOS- oder Linux-VM zur Verfügung stellt.
Funktionsweise. Leichtgewichtige VMs (unter Verwendung von Apples Virtualization-Framework auf Apple Silicon) sowie ein Agent-SDK, damit jedes Modell auf einem temporären Computer mit sauberem, reproduzierbarem Zustand ausgeführt werden kann.
Funktionsumfang. Es ist das Substrat, nicht das Gehirn – bringen Sie Ihr eigenes Modell und Ihre eigenen Richtlinien mit.
Lizenzierung. Open Source (MIT). Preise. Kostenlos bei Selbst-Hosting; eine Cloud-Container-Option wird angeboten.
Ideal für. Entwickler, die Isolation und Reproduzierbarkeit für Agenten-Ausführungen benötigen oder Agenten sicher testen möchten.
Einschränkungen. Sie müssen den Agenten weiterhin selbst erstellen; macOS-VM-Funktionen sind von Apple Silicon abhängig.
Open-Source-Prozessautomatisierung, die von aufgezeichneten menschlichen Interaktionen mit grafischen Benutzeroberflächen lernt.
Funktionsweise. Zeichnet Bildschirm, Maus und Tastatur auf, während eine Person eine Aufgabe ausführt, und nutzt dann große multimodale Modelle, um die Aufzeichnung in einen wiederholbaren, adaptiven Prozess zu verallgemeinern.
Einsatzbereich. Desktop-GUI-Aufgaben, die ein Mensch einmal demonstrieren kann; explizit auf Datenschutz ausgelegt, mit lokaler Bereinigung sensibler Daten.
Lizenzierung. Open Source (MIT). Preise. Kostenlos.
Ideal für. Teams, die den Ansatz „zeigen statt prompten“ bevorzugen und bei denen alles lokal bleiben soll.
Einschränkungen. Die auf Demonstrationen basierende Verallgemeinerung ist bei stark verzweigten Abläufen noch fehleranfällig; kleinere Community als bei Browser Use oder Skyvern.
Ein autonomer Softwareentwickler, der in seiner eigenen Cloud-Umgebung mit Editor, Shell und Browser arbeitet.
Funktionsweise. Sobald ein Ticket vorliegt, plant das System, schreibt Code, führt Tests aus, durchsucht Dokumentationen und erstellt einen Pull Request. Es arbeitet dabei asynchron in einem persistenten Arbeitsbereich, den Sie jederzeit einsehen und übernehmen können.
Funktionsumfang. Softwareentwicklungsaufgaben sowie unterstützende Web-Aktivitäten. Kein allgemeiner Automatisierungs-Agent für Büroanwendungen.
Lizenzierung. Geschlossen, gehostet. Preise. Nutzungsbasierte Abrechnung (ACU) zusätzlich zu einem Team-Plan; historisch gesehen einer der teureren Agenten pro Arbeitseinheit.
Ideal für. Entwicklungsteams, die klar definierte Aufgaben aus ihrem Backlog auslagern möchten. Einschränkungen. Kosten sowie das bekannte Muster: starke Leistung bei klar umrissenen Aufgaben, schwache Leistung bei unklaren Anforderungen.

Ein KI-Browser, dessen Assistent Aktionen auf den von Ihnen aufgerufenen Seiten ausführen kann.
Funktionsweise. Ein Chromium-basierter Browser mit integrierter Agenten-Seitenleiste, die den Kontext der aktuellen Seite und Tabs erfasst und mehrstufige Aktionen direkt im Browser unter Verwendung Ihrer bestehenden Logins ausführt.
Funktionsumfang. Browserbasiert und auf Endnutzer zugeschnitten: Preisvergleiche, Buchungen, E-Mail-Verwaltung und Zusammenfassungen offener Tabs.
Lizenzierung. Proprietär. Preise. Kostenlose Basisversion; intensivere Agentennutzung ist an kostenpflichtige Perplexity-Abos gebunden.
Ideal für. Privatpersonen, die sich bei der täglichen Internetnutzung von KI-Agenten unterstützen lassen möchten. Einschränkungen. Nicht für unbeaufsichtigte, prüfbare Geschäftsprozesse ausgelegt; funktioniert ausschließlich innerhalb des Browsers.

Eine Open-Source-Agenten-Runtime auf Basis von Open-Weight-Modellen, beliebt bei Teams, die ihre eigene Infrastruktur betreiben.
Funktionsweise. Eine Agentenschleife mit Tool-Calling-Funktion für die Hermes-Modellfamilie, je nach Konfiguration mit Zugriff auf Browser- und Shell-Tools.
Leistungsumfang. Vielseitig, erfordert jedoch eine Zusammenstellung durch Entwickler; am stärksten als vollständig selbst gehostete Lösung ohne Abhängigkeit von Drittanbietern.
Lizenzierung. Open Source (MIT). Preise. Kostenlos; die Kosten für Infrastruktur und Modellbereitstellung tragen Sie selbst.
Ideal für. Teams mit der strikten Anforderung, dass keine Daten ihre Infrastruktur verlassen.
Einschränkungen. Keine verwaltete Benutzeroberfläche, kein Support-SLA und die Qualität der GUI-Verankerung hängt vom jeweils verwendeten Vision-Modell ab.

Eine No-Code-Plattform zur Erstellung von KI-Assistenten für wiederkehrende Geschäftsprozesse.
Funktionsweise. Trigger-basierte Agenten, verbunden mit hunderten von SaaS-Integrationen, inklusive visuellem Editor und umfangreicher Vorlagenbibliothek; eine begrenzte Browser-Steuerungsfunktion ergänzt die Integrationsebene.
Funktionsumfang. Integrationsfokussiert – hervorragend bei vorhandenen Schnittstellen, eingeschränkt, wo keine vorhanden sind.
Lizenzierung. Proprietär, gehostet. Preise. Kostenlose Version mit monatlichen Aufgaben-Credits; kostenpflichtige Pläne bieten skalierbare Credits.
Ideal für. Nicht-technische Anwender automatisieren E-Mails, Terminplanung, CRM-Pflege und Lead-Nachverfolgung.
Einschränkungen. Kein echter Computer-Use-Agent: kein Desktop-Zugriff und die Abdeckung endet beim Connector-Katalog.

Eine Open-Source-Plattform für Workflow-Automatisierung mit erstklassigen KI-Agenten-Nodes.
Funktionsweise. Ein Knotengraph, den Sie visuell oder per Code erstellen; KI-Agenten-Nodes rufen Modelle und Tools auf, während Community-Nodes bei Bedarf Browser-Steuerung (Playwright, Browser Use) hinzufügen.
Funktionsumfang. Deterministische Orchestrierung mit optionalen agentischen Schritten – die umgekehrte Gewichtung eines Computer-Use-Agenten.
Lizenzierung. Source-available unter der Sustainable Use License (selbst hostbar, mit Einschränkungen beim Wiederverkauf). Preise. Kostenlos bei Selbst-Hosting; Cloud-Pläne werden pro Ausführung abgerechnet.
Ideal für. Technische Teams, die prüfbare, versionierte Pipelines benötigen und nur gelegentlich auf die Entscheidungsfindung von Modellen angewiesen sind.
Einschränkungen. Sie erstellen jeden Schritt selbst; nichts passt sich automatisch an UI-Änderungen an, es sei denn, Sie nehmen diese vor.

Agentische Automatisierung auf Basis des branchenweit größten Integrationskatalogs.
Funktionsweise. Agenten, die Zapiers App-Verbindungen als Werkzeuge nutzen, durch Ereignisse ausgelöst oder nach Zeitplan ausgeführt werden und deren Verhalten in natürlicher Sprache beschrieben wird.
Funktionsumfang. Alles, wofür es einen Zapier-Connector gibt. Keine Bildschirmerkennung, kein Desktop-Zugriff, kein GUI-Reasoning.
Lizenzierung. Proprietär, gehostet. Preise. Kostenlose Stufe mit begrenzter Agentenaktivität; kostenpflichtige Pläne basieren auf dem Aufgaben- bzw. Aktivitätsvolumen.
Ideal für. Unternehmen, die bereits Zapier nutzen und eine intelligentere Schnittstelle zwischen ihren Apps suchen.
Einschränkungen. Ausschließlich API-basiert – das genaue Gegenteil der Abdeckung, die ein Computer-Use-Agent bietet. Die Kosten steigen bei hohem Volumen schnell an.