Drei Thesen: (1) Der Begriff "Agent" ist heute präzise definiert — und die meisten sogenannten Agenten sind eigentlich Workflows. (2) Die Infrastruktur ist reif (MCP, Tool-Use-APIs, Computer Use), die Modelle sind es stellenweise auch — aber nicht gleich gut für alle Aufgaben. (3) In Produktion funktionieren enge, messbare Use Cases mit Human-in-the-Loop. Autonomes Agieren jenseits definierter Tool-Sets bleibt 2026 riskant.

01 · BegriffsklärungAgent vs. Workflow

In seinem Grundlagenpapier Building Effective Agents (Dezember 2024) unterscheidet Anthropic zwei Systemklassen — und beide laufen oft unter demselben Marketing-Label:

Workflows sind Systeme, in denen LLMs und Tools über fest programmierte Pfade orchestriert werden. Agenten sind Systeme, in denen LLMs ihre Prozesse und ihren Werkzeug-Einsatz dynamisch selbst lenken und dabei die Kontrolle darüber behalten, wie sie Aufgaben lösen. — Anthropic, Building Effective Agents (2024)

Der Unterschied ist praktisch. Ein Workflow ist deterministisch, testbar, billig; er kommt mit 1–3 LLM-Aufrufen aus. Ein echter Agent hat eine Schleife (reason → act → observe), trifft Entscheidungen, kann Tools verketten — und kostet das Fünf- bis Zwanzigfache pro Durchlauf. Anthropic selbst empfiehlt: Starten Sie mit Workflows. Upgraden Sie erst zu Agenten, wenn der zusätzliche Latenz- und Kostenaufwand messbar Mehrwert bringt.

OpenAIs Agents-SDK-Definition (2025) ergänzt: Ein Agent ist ein LLM mit instructions, tools, und optionalem Laufzeitverhalten wie handoffs, guardrails und structured outputs. Damit ist die Taxonomie ähnlich zur Anthropic-Definition.

02 · Die InfrastrukturWas seit Ende 2024 verfügbar ist

Zwischen Oktober 2024 und März 2025 wurde die technische Basis für produktive Agenten aufgebaut — von drei der vier großen Anbieter (Anthropic, OpenAI, Google) und der Open-Source-Community. Die wichtigsten Bausteine:

Computer Use (Anthropic, Oktober 2024)

Mit Claude 3.5 Sonnet (Version claude-3-5-sonnet-20241022) veröffentlichte Anthropic die erste allgemein verfügbare Screenshot-basierte Computer-Steuerung. Das Modell sieht einen Screenshot, schlägt Mausbewegungen und Tastatureingaben vor, führt aus, beobachtet das neue Screenshot. Auf dem OSWorld-Benchmark (Screenshot-only) erreichte Claude 3.5 Sonnet 14,9 % gegenüber 7,8 % beim vorher besten System — mit mehr erlaubten Schritten 22,0 %. Klingt niedrig, ist aber eine Verdopplung in einem ansonsten stagnierenden Feld.

Model Context Protocol (Anthropic, November 2024)

MCP ist ein offenes Protokoll auf Basis von JSON-RPC 2.0, das LLMs standardisiert an Tools und Daten anbindet — vergleichbar mit dem Sprung von proprietären Datenbank-Protokollen zu SQL. Drei Primitive: Tools (ausführbare Funktionen), Resources (Daten, auf die der Client zugreift), Prompts (vorgefertigte Interaktionsmuster).

MCP wurde zum Industriestandard schneller als jede frühere Anthropic-Initiative:

Für Unternehmen ist MCP der praktisch wichtigste Entwicklungspunkt: Ein Tool, das Sie einmal als MCP-Server bereitstellen (zum Beispiel einen Zugriff auf Ihre Warenwirtschafts-API), ist sofort für Claude, ChatGPT, Gemini, Cursor, Zed und andere nutzbar — ohne herstellerspezifische Adapter.

Operator & Responses API (OpenAI, Januar/März 2025)

Operator (23. Januar 2025) ist OpenAIs Gegenstück zu Computer Use — ein Browser-basierter Agent für ChatGPT-Pro-Nutzer, angetrieben vom "Computer-Using Agent"-Modell (GPT-4o-Vision + Reinforcement Learning). Operator erledigt Online-Formulare, Buchungen, Bestellungen.

Strategisch wichtiger ist die Responses API plus das Agents SDK (11. März 2025). Sie ersetzen die bisherige Assistants API (Sunset H1 2026) und liefern eingebaute Tools für Web Search, File Search und Computer Use. Das Agents SDK ist Open Source und funktioniert auch mit Drittanbieter-Modellen (Anthropic, Google, Meta, DeepSeek).

Deep Research (OpenAI Feb., Perplexity Feb. 2025)

OpenAI Deep Research (2. Februar 2025, zunächst ChatGPT Pro) erreicht auf dem anspruchsvollen Humanity's Last Exam 26,6 % — gegenüber 3,3 % bei GPT-4o. Perplexity Deep Research (14. Februar 2025) bietet dieselbe Produktkategorie als Freemium-Variante. Beide führen einen mehrstufigen Rechercheplan aus, besuchen Dutzende Quellen, synthetisieren einen umfangreichen Bericht.

03 · Was in Produktion läuftUse Cases mit Daten

Jenseits von Demos: Welche Anwendungsfälle erreichen 2026 belastbare Produktionsreife? Vier Kategorien, jede mit Zahlen — und bei Anbieter-Selbstangaben explizit markiert.

Kunden-Support

Der bestausgereifte Use Case. Intercom Fin berichtet über 40 Mio. gelöste Gespräche und eine Resolution-Rate von ~67 % (Stand Ende 2025, Intercom-eigene Angabe). Zendesk erklärt im Oktober 2025, sein neuer AI Agent löse 80 % der Support-Anfragen autonom (TechCrunch, Oktober 2025; ebenfalls Anbieter-Angabe). Beide Zahlen sind nicht unabhängig verifiziert, aber konsistent mit dem, was wir bei KMU-Implementierungen sehen: Bei klar abgegrenztem Wissensraum (FAQ, Produktdokumentation) und Escalation zu Menschen bei Unklarheit erreicht man Resolution-Raten im mittleren zweistelligen Bereich zuverlässig.

Code-Assistenz

Der nach Support am meisten etablierte Use Case — und der am besten gemessene. Cursor erreichte laut Marktberichten 2 Mrd. USD annualisierten Umsatz, das schnellste dokumentierte SaaS-Wachstum der Geschichte. Claude Code wird laut JetBrains-Research (April 2026) von rund 18 % der Entwickler im Job eingesetzt. Devin (Cognition Labs) startete im März 2024 mit 13,86 % auf SWE-bench Full und reported laut Annual Review 2025 eine PR-Merge-Rate von 67 %.

Wichtige Einschränkung: OpenAI hat SWE-bench Verified wegen dokumentierter Trainings-Kontamination als Benchmark verworfen und empfiehlt SWE-bench Pro. Frontier-Modelle reproduzierten in Tests wörtlich Patch-Lösungen, die sie "nie gesehen haben sollten" — unter anderem einen exakten Django-Authentication-Fix. Öffentliche Benchmark-Werte sollten deshalb mit Vorsicht interpretiert werden.

Research & Analyse

Deep-Research-Tools (OpenAI, Perplexity) sind für Desk-Research zur belastbaren Standard-Arbeitsweise geworden. Typischer Use Case: Due Diligence, Marktanalysen, Wettbewerbsübersichten. Zeiteinsparung gegenüber manueller Recherche bei komplexen Fragestellungen um den Faktor 3 bis 10 — mit der Einschränkung, dass das Ergebnis einer strengen Quellenprüfung bedarf. Die LLMs geben Links an, verwechseln aber Publikationen regelmäßig.

Sales & Prospecting

Die am wenigsten validierte Kategorie. Anbieter wie 11x.ai (Alice/Julian) oder Relevance AI bewerben autonome Sales-Agenten. Unabhängige Performance-Zahlen zu ROI, Gesprächsqualität oder Conversion-Raten sind Stand April 2026 rar. Für kritische Kommunikation (Outbound-Calls, persönliches E-Mail-Engagement) setzen Unternehmen deshalb weiterhin vorwiegend auf Workflows: der Agent bereitet vor, ein Mensch entscheidet.

04 · Der RealitätscheckWas Gartner und McKinsey sehen

Zwischen Demo-Video und Produktion gibt es eine Lücke. Die Zahlen dazu aus zwei Primärquellen:

>40%
der agentic-AI-Projekte werden bis Ende 2027 abgebrochen — wegen Kosten, unklarem Business-Value, fehlender Risikokontrolle
Gartner, 25. Juni 2025
23%
der Unternehmen skalieren Agenten bereits produktiv — aber in keiner Einzelfunktion über 10 %
McKinsey State of AI, Nov. 2025
<5% → 40%
Enterprise-Apps mit task-spezifischen Agenten: Prognose 2025 → Ende 2026
Gartner, 26. August 2025

Gartner-Analystin Anushree Verma fasst zusammen, die Mehrheit der Projekte seien "frühe Experimente oder Proofs of Concept, vom Hype getrieben" (Pressemitteilung Juni 2025). McKinsey bestätigt in der November-2025-Erhebung, dass 39 % der Unternehmen experimentieren — aber die Lücke zwischen POC und Skalierung ist das dominante Thema.

05 · Failure ModesAir Canada, Halluzination, Kosten-Explosion

Drei konkrete Ausfallmuster, die jeder Agent-Betrieb einplanen muss:

Moffatt v. Air Canada (Februar 2024)

Das British Columbia Civil Resolution Tribunal entschied am 14. Februar 2024, dass Air Canada für Fehlinformationen seines Website-Chatbots haftet. Der Bot hatte einem Hinterbliebenen erklärt, er könne einen Trauertarif rückwirkend innerhalb von 90 Tagen einfordern. Tatsächlich galt der Tarif nur bei Buchung vorher. Air Canada argumentierte, der Chatbot sei "eine separate juristische Einheit" — eine Position, die das Gericht als unhaltbar einstufte. Ergebnis: Haftung für die KI-generierte Auskunft, Schadensersatz CAD 812,02 (Zusammenfassung McCarthy Tétrault; Analyse American Bar Association).

Die Präzedenz gilt nicht direkt in Deutschland, die Logik sehr wohl: Aussagen auf Ihrer Website — egal ob von einem Mitarbeiter oder einem Agent — sind Ihre Aussagen. Der AGG (§§ 823 BGB, 241a BGB) plus die allgemeinen Haftungsgrundsätze liefern das Spiegelbild.

Tool-Use-Unzuverlässigkeit

Das Berkeley Function Calling Leaderboard (BFCL V4) zeigt: Topmodelle performen gut bei Single-Turn-Funktionsaufrufen, "stolpern aber, wenn sie Kontext über mehrere Turns halten, lange Gespräche managen oder entscheiden müssen, nicht zu handeln". Das ist der häufigste produktive Bruchpunkt — der Agent ruft Tools auf, wenn er eigentlich zurückfragen müsste.

Kosten-Explosion bei offenen Schleifen

Echte Agenten-Schleifen können ohne Limit laufen. Ein Agent, der ein schwer lösbares Problem bekommt, verbraucht in ein paar Minuten API-Kosten im dreistelligen Bereich. Jedes produktive System braucht: Max-Step-Limit, Kosten-Budget pro Durchlauf, Tool-Call-Rate-Limit, Menschliche Eskalation bei Unsicherheit.

06 · Rechtlicher RahmenEU AI Act — was gilt für Agenten

Der EU AI Act ist seit 1. August 2024 in Kraft, die Pflichten greifen gestaffelt:

Für Agenten im Betrieb folgen daraus drei konkrete Aufgaben: (1) Wenn ein Agent mit natürlichen Personen interagiert oder Inhalte erzeugt, gelten Transparenzpflichten — Nutzer müssen wissen, dass sie mit KI sprechen. (2) Für GPAI-basierte Agenten (also praktisch alle produktiven) gelten die GPAI-Dokumentationspflichten (siehe GPAI Guidelines Overview). (3) Wenn Ihr Agent in einen Hochrisiko-Bereich fällt (Beschäftigung, Bildung, Kreditwürdigkeit, Strafverfolgung, kritische Infrastruktur), kommen ab August 2026 umfangreiche Compliance-Pflichten hinzu.

07 · Architektur-PrinzipienWas produktive Agent-Systeme auszeichnet

Aus den bisher dokumentierten Erfolgen und Fehlschlägen lassen sich sechs Muster destillieren, die bei jedem produktiven Agent-Projekt einzuhalten sind:

  1. Workflow zuerst, Agent nur wenn nötig. Wenn 80 % Ihrer Aufgaben deterministisch lösbar sind, bauen Sie einen Workflow. Ein Agent kostet 10–20× mehr pro Lauf und ist schwerer zu debuggen.
  2. Enger Tool-Scope. Ein Agent mit 4 klar definierten Tools ist verlässlich. Mit 40 Tools wird er zum Glücksspiel. MCP hilft, aber nur wenn Sie disziplinieren, was Sie bereitstellen.
  3. Strukturiertes Output-Schema. Lassen Sie den Agent in validierte JSON-Schemata antworten. Weniger Halluzinationen, bessere Nachvollziehbarkeit, einfachere Tests.
  4. Human-in-the-Loop an den richtigen Stellen. Bei irreversiblen Aktionen (Zahlung, Vertrag, Kündigung, Mailing) ein menschlicher Bestätigungsschritt. Das ist nicht Rückschritt — das ist Betriebssicherheit.
  5. Kosten- und Schritt-Budget pro Lauf. Hard Limits auf Token-Verbrauch und Tool-Call-Anzahl. Eskalation bei Überschreitung.
  6. Observability von Tag 1. Jeder Agenten-Lauf loggen: Inputs, Entscheidungen, Tool-Calls, Outputs, Kosten. Ohne Traces können Sie weder debuggen noch auditieren.
Praxistipp

Ein gutes erstes Agent-Projekt ist ein internes Werkzeug mit enger Problemstellung und niedriger Fehlertoleranz — zum Beispiel ein Agent, der Eingangsrechnungen klassifiziert und an die passende Kostenstelle routet. Die Risiken sind überschaubar, der Lerneffekt hoch, und Sie sammeln belastbare Daten, bevor Sie an ein Kundensystem gehen.

08 · FazitWo 2026 die Linien verlaufen

Agenten sind keine Zukunftstechnologie mehr. Sie sind Infrastruktur in Beta, die inzwischen produktiv genug ist, um ernsthaft Nutzen zu stiften — aber noch nicht robust genug, um unbeaufsichtigt zu laufen. Die Gewinner der kommenden zwei Jahre sind nicht die Unternehmen mit den spektakulärsten Demos, sondern die mit der diszipliniertesten Praxis: enge Use Cases, klare Guardrails, echte Messung, saubere Dokumentation.

Wenn Sie 2026 einsteigen wollen, fangen Sie nicht mit einem autonomen Agenten an. Fangen Sie mit einem Workflow an. Verwenden Sie MCP, wo es Ihnen einen offenen Standard schenkt. Messen Sie Kosten pro Aufgabe, nicht Modelle pro Monat. Stellen Sie sicher, dass ein Mensch die Notbremse jederzeit ziehen kann — technisch und organisatorisch. Und dokumentieren Sie die Entscheidungen. In 18 Monaten wird ein Prüfer fragen, warum Sie Agent X eingesetzt und Guardrail Y konfiguriert haben.

Quellen

  1. Anthropic — Building Effective Agents (Dez. 2024) · anthropic.com
  2. Anthropic — Introducing Computer Use, and Claude 3.5 Sonnet (Okt. 2024) · anthropic.com
  3. Anthropic — Introducing the Model Context Protocol (Nov. 2024) · anthropic.com
  4. Anthropic — Donating MCP / Founding the AAIF (Dez. 2025) · anthropic.com
  5. MCP Anniversary Blog (Nov. 2025) · blog.modelcontextprotocol.io
  6. MCP Spezifikation · modelcontextprotocol.io
  7. OpenAI — Introducing Operator (Jan. 2025) · openai.com
  8. OpenAI Agents SDK · openai.github.io/openai-agents-python
  9. OpenAI — Responses API & Agents SDK (März 2025) · community.openai.com
  10. OpenAI — Introducing Deep Research (Feb. 2025) · openai.com
  11. Perplexity — Introducing Deep Research (Feb. 2025) · perplexity.ai
  12. OpenAI — Introducing SWE-bench Verified (Aug. 2024) · openai.com
  13. OpenAI — Why We No Longer Evaluate SWE-bench Verified · openai.com
  14. SWE-bench Leaderboard · swebench.com
  15. Gartner — >40 % Agentic AI Projects Canceled (Juni 2025) · gartner.com
  16. Gartner — Enterprise Apps AI Agents (Aug. 2025) · gartner.com
  17. McKinsey — The State of AI 2025 (Nov. 2025) · mckinsey.com
  18. Berkeley Function Calling Leaderboard · gorilla.cs.berkeley.edu
  19. Intercom — Customer Service Transformation Report 2025 · intercom.com
  20. TechCrunch — Zendesk AI Agent 80 % Resolution (Okt. 2025) · techcrunch.com
  21. JetBrains Research — AI Coding Tools at Work (April 2026) · blog.jetbrains.com
  22. Cognition Labs — Devin Annual Performance Review 2025 · cognition.ai
  23. McCarthy Tétrault — Moffatt v. Air Canada · mccarthy.ca
  24. American Bar Association — Air Canada Chatbot-Haftung · americanbar.org
  25. EU AI Act — Regulatory Framework · digital-strategy.ec.europa.eu
  26. EU AI Act — Implementation Timeline · artificialintelligenceact.eu
  27. EU AI Act — GPAI Guidelines Overview · artificialintelligenceact.eu