Das Repository lässt sich am besten als zwei verwandte Produkte verstehen, die sich ein Ökosystem teilen: Agent TARS bringt multimodale Agenten-Workflows auf Terminal-, Browser-, Computer- und Produktoberflächen; UI-TARS Desktop konzentriert sich auf einen nativen GUI-Agenten, der von UI-TARS- und Seed-Vision-Language-Modellen für lokale, Remote- und Browser-Steuerung angetrieben wird.
Get the latest on AI, LLMs & developer tools
New MCP servers, model updates, and guides like this one — delivered weekly.
UI-TARS Video ansehen
Lesen Sie lieber? Der folgende schriftliche Leitfaden behandelt den Stack, Setup-Pfade, Sicherheitswarnungen und Kompromisse.
Redaktioneller Hinweis
Dieser Artikel basiert auf dem GitHub-Repository, README, Quick-Start-Dokumenten, der Release-Liste, dem Issue-Tracker, dem PR-Tracker, Homepage-/Dokumentations-Links und dem Quellcode-Baum, recherchiert am 3. Juni 2026. Genaue Beliebtheitszahlen wurden weggelassen, da sie sich schnell ändern.
1. UI-TARS-desktop in einem Satz
UI-TARS Desktop ist ein Apache 2.0 TypeScript-Monorepo für multimodale GUI-Agenten, das Agent TARS CLI/Web UI sowie eine Desktop-Anwendung für Computer-Use mit visuellem Grounding, Browser-Operatoren, MCP-Integration und lokalen/Remote-Betriebsmodi bereitstellt.
| Bereich | Detail | Warum es wichtig ist |
|---|---|---|
| Repository | bytedance/UI-TARS-desktop | https://github.com/bytedance/UI-TARS-desktop |
| Primäre Sprache | TypeScript | Primäre GitHub-Sprache zum Recherchezeitpunkt. |
| Lizenz | Apache 2.0 | Gebündelte oder binäre Lizenzen gegebenenfalls separat prüfen. |
| Erstellt | 19. Januar 2025 | Letztes GitHub-Release geprüft: v0.3.0 am 4. November 2025; v0.2.4 enthielt Desktop-Binär-Assets, während die Release-Assets von v0.3.0 während der Recherche mehrdeutig waren. |
2. Warum es wichtig ist
Computer-Use-Agenten entwickeln sich von reinen Browser-Demos hin zu echten Desktop- und Produkt-Workflows. UI-TARS Desktop ist wichtig, weil es einen Vision-Language-Agenten, eine native Desktop-App, ein Browser-/Computer-Operator-Modell und ein MCP-basiertes Tool-Ökosystem in einem Open-Source-Repository vereint.
Die Trennung zwischen Agent TARS und UI-TARS Desktop ist wichtig. Agent TARS ist der breitere Stack: CLI, Web UI, Event-Stream, MCP, Browser-Agent und multimodaler Workflow. UI-TARS Desktop ist die GUI-Agenten-Anwendung, die mit lokalen oder Remote-Computern und Browsern interagiert.
Das Projekt ist auch eine nützliche Fallstudie zur Agentensicherheit. Ein System, das klicken, tippen, Shell-Befehle ausführen, Browser bedienen und MCP-Server mounten kann, benötigt Freigabeschranken, Sicherheits-Härtung, Koordinatenkorrektheit und eine klare Paketierung. Aktuelle PRs und Issues zeigen, dass diese Themen aktiv bearbeitet werden.
3. Architektur und Denkmodell
Das Repository ist ein TypeScript-Monorepo mit `apps`, `packages`, `docs`, `examples`, `infra`, `multimodal` und RFCs. Agent TARS stellt CLI- und Web UI-Oberflächen bereit, während UI-TARS Desktop lokale/Remote-Computer- und Browser-Operatoren bündelt, die von multimodalen Modellen gesteuert werden.
| Bereich | Detail | Warum es wichtig ist |
|---|---|---|
| Agent-Runtime | Agent TARS | CLI- und Web UI-Agent-Stack für multimodale Workflows und MCP-Tools. |
| Desktop-Produkt | UI-TARS Desktop | Nativer GUI-Agent für die Bedienung von lokalen Computern, Remote-Computern und Browsern. |
| Modellschicht | UI-TARS, Seed Vision-Language-Modelle, Provider-gestützte VLMs | Visuelle Erkennung und Aktionsvorhersage steuern die GUI-Kontrolle. |
| Tool-Schicht | MCP plus Browser-/Computer-Operatoren | Verbindet den Agenten mit realen Tools und UI-Oberflächen. |
| Event-Stream | Protokollgesteuerter Event-Stream | Wird für Context Engineering, Debugging und den UI-Zustand des Agenten verwendet. |
| Dokumentation und Beispiele | `docs`, `examples`, `agent-tars.com` | Schnellstart, Provider-Einrichtung, CLI/Web UI, Browser, MCP und Showcase-Material. |
| Release-Packaging | GitHub-Releases und npm-Paket | Agent TARS CLI hat eine Release-Historie; die Auffindbarkeit der Desktop-Binärdatei scheint eine Benutzerfrage zu sein. |
4. Kleinster End-to-End-Setup
Die folgenden Befehle stammen aus der Repository-Dokumentation und wurden mit dem aktuellen Recherche-Snapshot abgeglichen. Behandle sie als Startpunkt und lies anschließend die verlinkte README, bevor du in einer Produktionsumgebung installierst.
# Agent TARS CLI; package metadata observed Node >= 22.15.0
npx @agent-tars/cli@latest
# Global install
npm install @agent-tars/cli@latest -g
# Run with a provider/model
agent-tars --provider volcengine --model doubao-1-5-thinking-vision-pro-250428 --apiKey your-api-key
agent-tars --provider anthropic --model claude-3-7-sonnet-latest --apiKey your-api-key
# UI-TARS Desktop local development; root repo uses pnpm
pnpm i
pnpm dev:ui-tarsEine kleine erste Aufgabe sollte die Integration beweisen, bevor du sie mit kritischen Daten oder großen Workspaces verbindest.
# Desktop user path
brew install --cask ui-tars
# Read the repo quick-start first:
# https://github.com/bytedance/UI-TARS-desktop/blob/main/docs/quick-start.md
# Mental model:
# 1. choose local, remote computer, or browser operator
# 2. configure a supported vision-language model
# 3. verify single-monitor/browser/operator constraints
# 4. grant only the permissions needed for the target task
# 5. test on a harmless UI before using real accounts or paid actions5. Technischer Deep Dive
5.1 Agent TARS und UI-TARS Desktop lösen verwandte Probleme
Die README präsentiert TARS als multimodalen Agent-Stack mit zwei ausgelieferten Projekten. Agent TARS zielt auf Terminal-, Computer-, Browser- und Produkt-Workflows mittels CLI und Web UI ab. UI-TARS Desktop ist die native GUI-Agent-Anwendung für die Bedienung von lokalen oder Remote-Computern/Browsern.
Diese Unterscheidung verhindert Verwirrung bei der Einrichtung. Wenn Sie einen CLI/Web UI-Agenten mit MCP-Tools wünschen, beginnen Sie mit Agent TARS. Wenn Sie einen Desktop-GUI-Operator auf Basis von UI-TARS-Modellen suchen, lesen Sie den Desktop-Schnellstart und die Hinweise zur Modellbereitstellung.
5.2 Visual Grounding ist die Kernfähigkeit
Ein GUI-Agent muss den Bildschirm sehen, das Zielelement ableiten und dieses Ziel auf Maus- und Tastaturaktionen abbilden. Die README hebt die Unterstützung für Screenshots und visuelle Erkennung, präzise Maus-/Tastatursteuerung sowie Beispiele wie das Ändern von VS Code-Einstellungen oder die Bedienung eines Browsers hervor.
Das Risiko ist Koordinatendrift. Zu den aktuellen Problemen gehören Offsets bei der Klickvorhersage in neueren macOS-Umgebungen und Interaktionen, die fehlschlagen, wenn die App sich selbst in den Vordergrund bringt. Das sind keine kosmetischen Fehler; sie beeinflussen direkt, ob ein Agent sicher auf einer UI agieren kann.
5.3 Browser-Bedienung ist nicht nur DOM-Automatisierung
Agent TARS bewirbt einen hybriden Browser-Agenten: GUI-Agent, DOM oder hybride Steuerung. Das ist wichtig, da echte Websites visuelle Zustände, dynamische DOMs, Berechtigungen, iframes, canvas und Anti-Automatisierungsverhalten mischen.
Eine hybride Strategie ermöglicht es dem Agenten, die DOM-Struktur zu nutzen, wenn sie zuverlässig ist, und visuelles Grounding, wenn die Seite besser als Pixel verstanden wird. Dies erhöht auch die Komplexität, da der Agent entscheiden muss, welcher Beobachtungs-/Aktionskanal maßgeblich ist.
Browser task:
visual screenshot
+ DOM structure where available
+ MCP/tool context
-> action plan
-> click/type/navigation
-> event stream for review/debugging5.4 MCP macht den Agenten zu einem Tool-Host
Die README besagt, dass der Agent TARS-Kernel auf MCP basiert und das Einbinden von MCP-Servern unterstützt. Das ist wichtig, da ein Computer-Use-Agent nicht für alles Pixel verwenden sollte. Wetterdaten, Diagramme, Dateien, Dokumente, APIs und interne Tools sind über typisierte Tools oft sicherer.
Die MCP-Schicht erhöht auch die Sicherheitslast. Tool-Description-Injection und Output-Sanitization tauchen im Issue-Tracker auf, während PRs Sicherheits-Gates für Befehle hinzufügen und Sicherheitsprüfungen verschärfen. Genau das sind die Stellen, an denen ein multimodaler Agent-Stack Aufmerksamkeit benötigt.
5.5 Releases sind nicht die ganze Geschichte der Aktualität
Das letzte geprüfte GitHub-Release war v0.3.0 vom November 2025, aber Issues und PRs liefen bis Mai 2026 weiter. Das bedeutet, dass die Release-Seite die Aktivität des Live-Repos nicht vollständig beschreibt.
Es gibt auch eine Nuance bei der Paketierung: Die Liste der Release-Assets für v0.3.0 war während der Recherche mehrdeutig, während v0.2.4 Desktop-Assets wie DMG/EXE/ZIP/Update-Dateien enthielt. Für Benutzer wirft dies eine praktische Einrichtungsfrage auf: ob man Agent TARS CLI, Homebrew Cask, ein früheres Desktop-Binary-Release, einen Source-Checkout oder die Dokumentation von der Website verwenden soll.
6. Praxis: Falsch vs. richtig
| Falsch | Richtig | Grund |
|---|---|---|
| Betrachten Sie Computer-Use-Steuerung nicht als gewöhnliche Chat-Automatisierung. | Betrachten Sie es als einen UI-Operator mit Berechtigungen und echten Nebenwirkungen. | Klick-/Tipp-Aktionen können Daten kaufen, löschen, senden oder offenlegen. |
| Starten Sie nicht mit einem echten Konto, das Geld oder sensible Daten enthält. | Führen Sie zuerst Smoke-Tests mit harmlosen lokalen Apps und temporären Browser-Sitzungen durch. | Koordinaten-, Fokus- und Modell-Grounding-Fehler sind möglich. |
| Gehen Sie nicht davon aus, dass die Desktop-App und Agent TARS CLI auf die gleiche Weise installiert werden. | Wählen Sie den Pfad, der zu Ihrem Anwendungsfall passt: CLI/Web UI oder nativer Desktop-Operator. | Das Repo liefert zwei verwandte, aber unterschiedliche Produkte aus. |
| Binden Sie keine beliebigen MCP-Server ohne Überprüfung ein. | Überprüfen Sie Tool-Beschreibungen, Output-Handling, Befehlsberechtigungen und Netzwerkumfang. | MCP erweitert sowohl die Fähigkeiten als auch die Angriffsfläche. |
7. Häufige Fehler und aktuelle Probleme
Der Issue Tracker ist wichtig, weil diese Repos jung sind und sich schnell bewegen. Der Artikel nutzt Issues als Risikosignale, nicht als Beweis dafür, dass ein Projekt unbrauchbar ist.
| Bereich | Detail | Warum es wichtig ist |
|---|---|---|
| Auffinden von ausführbaren Dateien | Issue #1878 fragt, wo eine Desktop-exe von v0.3.0 heruntergeladen werden kann. | Die Erwartungen an die Paketierung stimmen möglicherweise nicht mit den Release-Assets überein. |
| Einschränkung auf einen Monitor | Die Quick-start-Dokumentation weist auf die Grenzen der Unterstützung für Einzelmonitore hin. | Multi-Monitor-Desktop-Setups können bei einigen Aufgaben fehlschlagen. |
| Lebenszyklus des Remote-Operators | Die Dokumentation verwies auf die Einstellung des Remote-Operator-Dienstes und Alternativen zur Selbstbereitstellung. | Überprüfen Sie den aktuellen Dienststatus, bevor Sie sich auf gehostete Remote-Operatoren verlassen. |
| Koordinatenabweichung | Ausgabe #1876 berichtet von einem Versatz der Klickmarkierung unter macOS Tahoe 26. | GUI-Agenten benötigen eine plattformspezifische Koordinatenüberprüfung. |
| Fensterfokus | Ausgabe #1864 berichtet, dass sich die Desktop-App vor den Vorgängen in den Vordergrund drängt. | Das Fokusverhalten kann die Automatisierung der Ziel-App unterbrechen. |
| Sicherheitsberichte | Ausgabe #1854 diskutiert die Injektion von Tool-Beschreibungen und die Bereinigung von Ausgaben. | Betrachten Sie die Sicherheitshärtung als einen aktiven Bereich. |
| Verwirrung bei der Einrichtung | Ausgabe #1851 fragt, ob die Modellbereitstellung/-konfiguration ausreicht. | Die Einrichtung von Modell, App und Operator sollte gemeinsam überprüft werden. |
| Genehmigungsschranken | PR #1909 fügt eine Genehmigungsschranke für die Befehlssicherheit hinzu. | Sicherheitskontrollen werden derzeit über PRs implementiert. |
8. Performance-, Skalierungs- und Kostennotizen
Die Leistung für UI-Agenten hängt nicht nur von der Token-Geschwindigkeit ab. Es ist der Kreislauf von Screenshot über Modell-Reasoning bis hin zur Aktionsvorhersage und UI-Feedback. Latenz, Bildschirmauflösung, Reaktionsfähigkeit der Ziel-App und die visuelle Präzision des Modells spielen alle eine Rolle.
Remote-Operatoren fügen eine weitere Dimension hinzu: Netzwerkverzögerung und Zustand der Remote-Umgebung. Ein Remote-Browser oder -Computer lässt sich zwar leichter in einer Sandbox isolieren, ist aber schwerer reaktionsschnell zu gestalten.
MCP kann die Leistung verbessern, indem pixelbasierte Operationen durch typisierte Tool-Aufrufe ersetzt werden. Zum Beispiel sollte das Generieren eines Diagramms über einen MCP Server zuverlässiger sein als das manuelle Klicken durch eine Tabellenkalkulations-UI.
9. Für wen es geeignet ist
| Verwenden, wenn | Überspringen, wenn |
|---|---|
| Sie experimentieren mit multimodalen GUI-Agenten und Browser-/Computer-Operatoren. | Sie benötigen ein konservatives Enterprise-RPA-Produkt mit festen Releases und Support-SLAs. |
| Sie wünschen sich einen offenen Stack rund um UI-TARS, Agent TARS, MCP, CLI und Web UI. | Sie benötigen lediglich Headless-Browser-Scripting mittels Playwright. |
| Sie können Aktionen in sandboxed Apps testen, bevor Sie einen umfassenden Desktop-Zugriff gewähren. | Sie können gelegentliche Probleme mit Koordinaten, Fokus oder Provider-Setups nicht tolerieren. |
| Sie möchten untersuchen, wie Event-Streams und multimodales Context-Engineering funktionieren. | Sie wünschen sich eine Desktop-App, die mit einem einzigen Befehl paketiert ist und keine Modellkonfiguration erfordert. |
10. Community-Signal
Das Repo hat eine lange Liste an Issues und PRs, einschließlich Community-Anfragen zu Providern, Klarheit bei der Desktop-Paketierung, Verhalten von Remote-/Browser-Operatoren, Richtungen für Mobile/iOS, Sicherheits-Härtung und Ausführung mit Genehmigungspflicht.
Das stärkste technische Signal ist, dass Mitwirkende nicht nur nach Features fragen, sondern auch Sicherheits-Gates, Sicherheitsüberprüfungen, Provider-Support, geplante Aufgaben und Ideen für simulationsbasierte Ausführungen vorantreiben.
Die größte Warnung ist, dass GUI-Agenten auf eine Weise scheitern, wie es Text-Agenten nicht tun: Bildschirm-Skalierung, Fokus, Browser-Profile, Berechtigungen und Berichte über schwarze Bildschirme beeinträchtigen die Nutzbarkeit.
11. Das Urteil: Lohnt sich die Nutzung?
Unsere Einschätzung
Verwenden Sie UI-TARS Desktop und Agent TARS, wenn Sie ernsthafte Open-Source-Agenten für multimodale Computernutzung erforschen möchten und den Workflow in einer Sandbox isolieren können. Verzichten Sie darauf für kritische, unbeaufsichtigte Desktop-Automatisierung, bis Sie das Modell-Setup, die Klick-Genauigkeit, Berechtigungs-Gates und die MCP-Sicherheit in Ihrer spezifischen Umgebung verifiziert haben.
12. Das große Ganze
UI-TARS Desktop fällt in dieselbe Kategorie wie browser-use, computer-use Agenten und multimodale Operator-Frameworks, ist jedoch ungewöhnlich breit gefächert, da es Modelle, Desktop-App, CLI, Web UI, MCP, Event-Streams und Remote-Betrieb kombiniert.
Der größere Wandel besteht darin, dass Agenten zu Betriebsoberflächen werden, nicht nur zu Coding-Assistenten. Sobald ein Modell einen Desktop sehen und darauf agieren kann, wird das technische Problem zu einer Frage von Berechtigungen, Observability, Rollback und menschlicher Überprüfung.
13. Häufig gestellte Fragen
F: Was ist der Unterschied zwischen Agent TARS und UI-TARS Desktop?
Agent TARS ist der breitere multimodale Agenten-Stack für CLI/Web UI. UI-TARS Desktop ist die native GUI-Agenten-Anwendung für den lokalen Betrieb, Remote-Computer und Browser-Operationen.
F: Muss ich mein eigenes Modell bereitstellen?
Das hängt vom gewählten Pfad ab. Agent TARS kann mit konfigurierten Modell-Providern ausgeführt werden; UI-TARS Desktop erwartet OpenAI-compatible VLM-Endpunkteinstellungen wie Provider, Base URL, API key und Modellname.
F: Wird MCP verwendet?
Ja. Die README besagt, dass der Agent TARS Kernel auf MCP basiert und das Einbinden von MCP Servern unterstützt, um reale Tools anzubinden.
F: Ist es sicher, es meinen Computer steuern zu lassen?
Nur mit Sandboxing, sorgfältigen Berechtigungen und menschlicher Überprüfung. Aktuelle PRs zu Befehlsgenehmigungen und Sicherheitsüberprüfungen zeigen, dass dies ein aktives Anliegen ist.
F: Warum sind GUI-Agenten schwer zuverlässig zu machen?
Sie hängen von Screenshots, Skalierung, Fokus, Koordinaten-Mapping, App-Status, Browser-Profilen und visuellem Schlussfolgern des Modells ab, die je nach Plattform variieren können.
F: Welches Release sollte ich prüfen?
Verwenden Sie die neuesten Dokumentationen und die Release-Seite zusammen. Das zuletzt geprüfte Release war v0.3.0 vom November 2025, während v0.2.4 Desktop-Binär-Assets enthielt und Issues/PRs bis 2026 fortgesetzt wurden.
14. Glossar
| Bereich | Detail | Warum es wichtig ist |
|---|---|---|
| GUI-Agent | Agent, der eine grafische Benutzeroberfläche durch Bildschirmbeobachtung und Aktionen steuert. | Die Kernkategorie von UI-TARS Desktop. |
| Visual Grounding | Mapping von Bildschirm-Pixeln auf beabsichtigte UI-Elemente. | Kritisch für die Genauigkeit bei Klicks/Eingaben. |
| MCP | Model Context Protocol. | Tool-Server-Protokoll, das von Agent TARS eingebunden wird. |
| Operator | Steuerungsmodus für lokalen Computer, Remote-Computer oder Browser. | Die Aktionsschicht. |
| Event-Stream | Strukturierter Fluss von Agenten-, Tool- und Runtime-Ereignissen. | Nützlich für Debugging und Agenten-UI. |
| VLM | Vision-Language Model. | Modellklasse, die Screenshots und Text liest. |
15. Alle Quellen und Links
Primärquellen
Issues und PRs
Interne Links
16. Tabelle zur Quellenzuordnung
| Bereich | Detail | Warum es wichtig ist |
|---|---|---|
| README | Zwei-Projekt-Struktur, Agent TARS Funktionen, UI-TARS Desktop Funktionen, Installationsbefehle. | Primärquelle. |
| Dokumentation | Schnellstart, Anbieter-/Modell-Einrichtung, CLI/Web UI Anleitung. | Primärquelle. |
| Release-Liste | Zeitplan für das v0.3.0 Release. | Quelle für Aktualität. |
| Issues | Hinweise zu Packaging, Einrichtung, Koordinaten, Fokus und Sicherheit. | Community-Signal. |
| PRs | Freigabeprozesse, Sicherheitsoptimierungen, Provider, geplante Aufgaben. | Signal für aktive Entwicklung. |
Get the Ultimate Antigravity Cheat Sheet
Join 5,000+ developers and get our exclusive PDF guide to mastering Gemini 3 shortcuts and agent workflows.
Related Guides
Humanizer Skill Guide
blader/humanizer: 29 AI-writing patterns, voice calibration, and a two-pass audit, all in one Claude Code skill.
Guides & FeaturesMastering Agent Skills
The open standard for portable AI agent expertise.
Guides & FeaturesAntigravity Workflows Guide
Create automation recipes with Turbo Mode and AgentKit 2.0.
Guides & FeaturesHow to Change Antigravity Themes
Customize themes, dark mode, icons, and color schemes.
Guides & FeaturesHow to Change Language
Switch Antigravity to Spanish, German, Japanese, and more.
Guides & FeaturesAntigravity Security Guide
Known vulnerabilities, safe settings, and hardening steps.
