Ein Sprachmodell beantwortet eine Frage. Ein KI-Agent erledigt eine Aufgabe. Dieser Unterschied klingt klein, verändert aber alles, was danach kommt: die Architektur, die Kosten, die Fehlerquellen und die Frage, wer haftet, wenn etwas schiefgeht. KI-Agenten planen Schritte, rufen Werkzeuge auf, lesen Ergebnisse, korrigieren sich und arbeiten so lange weiter, bis ein definiertes Ziel erreicht ist oder ein Abbruchkriterium greift.
Der Begriff wird inflationär benutzt. Vieles, was als Agent verkauft wird, ist ein Chatbot mit besserem Prompt. Deshalb lohnt es sich, die Mechanik genau anzuschauen.
Der Unterschied zwischen Chatbots und KI-Agenten
Klassische Chatbots arbeiten in einem Zug: Eingabe rein, Antwort raus. Sie haben keinen Zugriff auf externe Systeme, keine Möglichkeit, das Ergebnis ihrer eigenen Arbeit zu überprüfen, und keinen Zustand über die Konversation hinaus. Wenn ein Nutzer nach dem Status einer Bestellung fragt, liefert ein solcher Bot eine plausible Formulierung, aber keine echten Daten.
KI-Agenten drehen die Logik um. Sie bekommen ein Ziel, nicht eine Frage. Aus diesem Ziel leiten sie selbst Zwischenschritte ab. Sie entscheiden, welche Informationen fehlen, holen sie über Schnittstellen, Datenbanken oder Websites, bewerten das Ergebnis und gehen zum nächsten Schritt. Diese Schleife aus Beobachten, Denken, Handeln ist der Kern jeder agentischen Architektur.
Ein Beispiel aus dem Alltag: Die Aufgabe lautet, alle offenen Rechnungen aus dem Vormonat zu identifizieren, die Kunden per E-Mail zu erinnern und die Vorgänge im CRM zu dokumentieren. Ein Chatbot kann darüber sprechen. Ein Agent öffnet die Buchhaltungs-API, filtert die Datensätze, erzeugt personalisierte E-Mails, verschickt sie und schreibt anschließend Notizen zurück ins System. Zwischen beiden liegt kein besseres Modell, sondern eine andere Systemarchitektur.
Was macht einen KI-Agenten aus? Vier Bausteine
Ob ein System wirklich ein Agent ist, lässt sich an vier Komponenten prüfen. Fehlt eine davon, bleibt es ein Assistent oder eine Automatisierung mit KI-Anstrich.
Wahrnehmung: woher die Daten kommen
Agenten brauchen Zugang zur Realität. Das können strukturierte Quellen sein wie ERP-Datenbanken, Ticketsysteme, Kalender, Postfächer oder Produktkataloge. Es können auch unstrukturierte Quellen sein: PDF-Rechnungen, Protokolle, Websites.
Der Zugriff auf Websites ist technisch der unangenehmste Teil. Ein Browser-Agent muss mit Layouts umgehen, die sich ändern, mit Login-Masken, mit Rate Limits und mit Cookie-Bannern, die jede Interaktion blockieren, bevor überhaupt Inhalte sichtbar werden. Praktisch lösen Teams das über persistente Browserprofile: Der Agent arbeitet in einer Session, in der die Cookies bereits gesetzt sind, Session-Cookies erhalten den Login über mehrere Schritte hinweg, und die Einwilligung zu Cookies wurde einmalig geklärt. Wo das nicht möglich ist, klickt der Agent das Cookie-Banner selbst weg, was die Fehlerquote spürbar erhöht. Wer Agenten auf fremde Websites loslässt, sollte deshalb vorab klären, ob Nutzungsbedingungen und Cookie-Einwilligung automatisierte Zugriffe überhaupt zulassen.
Planung: Ziele in Schritte zerlegen
Das Sprachmodell übernimmt hier die Rolle des Planers. Es zerlegt ein grob formuliertes Ziel in konkrete Schritte, priorisiert sie und entscheidet nach jedem Zwischenergebnis neu. Genau diese Fähigkeit, auf Basis unvollständiger Informationen Entscheidungen zu treffen, unterscheidet KI-Agenten von starren Workflows. Ein klassischer Workflow kennt jeden Pfad vorab. Ein Agent findet den Pfad zur Laufzeit.
In der Praxis wird die Planung selten völlig frei gelassen. Die meisten produktiven Systeme arbeiten mit einem Korridor: Der Agent darf zwischen zwanzig definierten Werkzeugen wählen und maximal fünfzehn Schritte ausführen, bevor er abbricht oder an einen Menschen übergibt. Diese Begrenzung ist kein Rückschritt, sondern Voraussetzung dafür, dass Kosten und Verhalten kalkulierbar bleiben.
Werkzeuge: die Hände des Agenten
Ohne Tools bleibt jeder Agent ein Textgenerator. Tools sind Funktionen mit klarer Signatur: eine Suche im Produktkatalog, ein Datenbank-Query, das Versenden von E-Mails, das Anlegen eines Tickets, eine Rechenoperation, ein Aufruf der Wetter-API. Das Modell bekommt die Beschreibung jedes Werkzeugs und entscheidet, welches es mit welchen Parametern aufruft.
Die Qualität eines Agenten hängt stärker von der Gestaltung dieser Werkzeuge ab als vom gewählten Modell. Schlecht benannte Funktionen, vage Parameterbeschreibungen und Tools, die im Fehlerfall nur einen HTTP-Statuscode zurückgeben, führen zu Agenten, die im Kreis laufen. Gute Tools geben verständliche Fehlermeldungen zurück, damit das Modell den nächsten Schritt korrigieren kann.
Gedächtnis: Kontext über Schritte hinweg
Ein Agent muss wissen, was er bereits versucht hat. Kurzzeitgedächtnis bedeutet, dass alle bisherigen Schritte, Tool-Aufrufe und Ergebnisse im Kontextfenster bleiben. Langzeitgedächtnis bedeutet, dass Informationen in einer Vektordatenbank oder einem klassischen Speicher abgelegt und bei Bedarf zurückgeholt werden. Im Laufe der Zeit entsteht so ein Erfahrungsschatz: Welcher Kunde bevorzugt welchen Tonfall, welche Lieferanten antworten langsam, welche Anfragen brauchen immer eine Freigabe.
Wie ein Agentenlauf abläuft: Schritt für Schritt Anleitung
Die folgende Schritt für Schritt Anleitung beschreibt einen typischen Durchlauf, wie ihn Frameworks wie LangGraph oder das OpenAI Agents SDK intern organisieren. Beispielaufgabe: eingehende Support-E-Mails klassifizieren und beantworten.
- Ziel entgegennehmen. Der Agent erhält die Aufgabe samt Randbedingungen: nur E-Mails der letzten 24 Stunden, keine Zusagen zu Preisnachlässen, Antworten in der Sprache des Absenders.
- Kontext sammeln. Er ruft das Postfach-Tool auf und holt die unbeantworteten Nachrichten. Dazu kommen Daten aus dem CRM: Kundenstatus, offene Tickets, Vertragslaufzeit.
- Planen. Das Modell entscheidet, welche E-Mails es selbst beantworten kann und welche eskaliert werden müssen. Reklamationen über 500 Euro gehen direkt an einen Menschen.
- Handeln. Für jede verbleibende Nachricht sucht der Agent in der Wissensdatenbank nach passenden Artikeln und formuliert eine Antwort.
- Prüfen. Ein Validierungsschritt kontrolliert, ob die Antwort die Regeln verletzt, ob Platzhalter übrig geblieben sind und ob der Ton passt. Fällt die Prüfung negativ aus, geht es zurück zu Schritt vier.
- Abschließen. Die E-Mails werden versendet oder als Entwurf abgelegt, das Ticket wird aktualisiert, ein Protokoll aller Schritte landet im Log.
- Lernen. Korrekturen durch Mitarbeiter werden gespeichert und fließen in künftige Durchläufe ein.
Jeder dieser Schritte kostet einen Modellaufruf, manchmal mehrere. Ein Durchlauf mit zwölf Schritten verbraucht schnell das Zehnfache eines einzelnen Chat-Prompts. Wer Agenten produktiv betreibt, sollte deshalb von Beginn an messen, wie viele Schritte ein typischer Lauf braucht.
Welche KI-Agenten gibt es? Typen nach Aufgabe und Autonomie
Die Lehrbuchtaxonomie aus der klassischen KI-Forschung ist immer noch brauchbar, auch wenn moderne Systeme Mischformen sind.
Reflex- und regelbasierte Agenten
Sie reagieren auf einen Auslöser mit einer festen Handlung. Kommt eine E-Mail mit dem Wort Kündigung herein, wird sie an das Retention-Team weitergeleitet. Kein Gedächtnis, keine Planung, extrem zuverlässig. Für viele Aufgaben reicht das völlig, und es ist deutlich günstiger als ein Modellaufruf.
Zielbasierte und nutzenbasierte Agenten
Hier kommt die Bewertung ins Spiel. Ein zielbasierter Agent prüft bei jedem Schritt, ob eine Handlung dem Ziel näherkommt. Ein nutzenbasierter Agent wägt zusätzlich ab: Schnelligkeit gegen Genauigkeit, Kosten gegen Qualität. Beim Einkauf von Werbeflächen etwa entscheidet ein solcher Agent nicht nur, ob ein Ziel zu erreichen ist, sondern zu welchem Preis das sinnvoll bleibt.
Lernende Agenten
Diese Systeme passen ihr Verhalten anhand von Rückmeldungen an. Im Laufe der Zeit sinkt die Zahl der Eskalationen, weil der Agent erkennt, welche Formulierungen Rückfragen provozieren. Technisch passiert das selten durch Feintuning des Modells, sondern über wachsende Beispielsammlungen, angepasste Prompts und bessere Retrieval-Strategien.
Agenten nach Einsatzumgebung
- Web-Agenten bedienen Browser, füllen Formulare, extrahieren Informationen von Websites, verwalten Cookies und Logins.
- Coding-Agenten lesen Repositories, schreiben Code, führen Tests aus und öffnen Pull Requests.
- Daten-Agenten übersetzen Fragen in SQL, prüfen Plausibilität und bauen Auswertungen.
- Kommunikations-Agenten arbeiten in Postfächern, Chatkanälen und Ticketsystemen.
- Prozess-Agenten orchestrieren Abläufe über mehrere Fachsysteme hinweg, etwa vom Angebot bis zur Rechnung.
Agentische KI: wie viel Autonomie sinnvoll ist
Agentische KI ist kein Schalter, sondern eine Skala. Auf der untersten Stufe schlägt das System nur vor, ein Mensch bestätigt jede Aktion. Eine Stufe darüber handelt der Agent selbstständig, aber alle Schritte sind vordefiniert. Weiter oben wählt er Werkzeuge und Reihenfolge frei und holt nur bei kritischen Aktionen eine Freigabe ein. Ganz oben laufen Agenten dauerhaft im Hintergrund, starten sich selbst über Trigger und melden sich nur bei Problemen.
Der Fehler, den viele Projekte machen: Sie starten oben. Das Ergebnis sind Systeme, die in acht von zehn Fällen beeindrucken und in zwei Fällen Schaden anrichten, der die Ersparnis auffrisst. Sinnvoller ist der umgekehrte Weg. Erst Vorschlagsmodus, Messung der Trefferquote über mehrere Wochen, dann schrittweise Freigabe einzelner Aktionen. Autonomie wird verdient, nicht konfiguriert.
Ein gutes Kriterium für die Frage, wie viel Autonomie vertretbar ist: Wie teuer ist die Korrektur eines Fehlers? Ein falsch formulierter Entwurf kostet zwei Minuten. Eine versehentlich an 4.000 Empfänger verschickte E-Mail kostet deutlich mehr. Aktionen mit hoher Reichweite und schlechter Reversibilität gehören hinter eine menschliche Freigabe.
Multi Agent Systeme: Arbeitsteilung zwischen Spezialisten
Ein einzelner Agent mit dreißig Werkzeugen und einem Prompt von 4.000 Tokens wird unzuverlässig. Multi Agent Systeme lösen das über Spezialisierung: Mehrere Agenten mit jeweils klar begrenztem Aufgabenbereich arbeiten zusammen, koordiniert durch einen Orchestrator.
Ein typisches Muster im Marketing sieht so aus: Ein Recherche-Agent sammelt Informationen zu einem Thema aus internen Quellen und externen Websites. Ein Autoren-Agent erstellt daraus einen Entwurf. Ein Prüf-Agent kontrolliert Fakten, Tonalität und rechtliche Vorgaben. Ein Publishing-Agent legt den Text im CMS an. Der Orchestrator verteilt die Aufgaben, sammelt Ergebnisse und entscheidet über Wiederholungen.
Die Vorteile solcher Multi Agent Systeme sind messbar. Jeder Agent hat einen kurzen, präzisen Prompt und wenige Werkzeuge, was die Fehlerquote senkt. Einzelne Rollen lassen sich austauschen, ohne das Gesamtsystem anzufassen. Und man kann pro Rolle unterschiedliche Modelle einsetzen: ein schnelles, günstiges Modell für Klassifikation, ein starkes für die Endredaktion.
Die Nachteile sind ebenso real. Kommunikation zwischen Agenten kostet Tokens und Zeit. Fehler pflanzen sich fort, wenn ein Agent halluzinierte Informationen an den nächsten weitergibt. Und Debugging wird anspruchsvoll, weil ein Lauf über fünf Agenten und vierzig Schritte schnell unübersichtlich wird. Ohne ordentliches Tracing, das jeden Aufruf mit Eingabe, Ausgabe und Kosten protokolliert, sind komplexe Agenten-Workflows kaum wartbar.
Faustregel aus der Praxis: Ein Agent ist der Startpunkt. Erst wenn Prompt und Werkzeugliste unübersichtlich werden oder klar getrennte fachliche Rollen existieren, lohnt der Schritt zu mehreren Agenten.
KI-Assistenten, Chatbots und Agenten im direkten Vergleich
Die Begriffe werden durcheinandergeworfen, obwohl der Unterschied im Projektalltag sehr konkrete Folgen hat.
| Merkmal | Chatbot | KI-Assistent | KI-Agent |
|---|---|---|---|
| Auslöser | Nutzerfrage | Nutzerfrage | Ziel oder Ereignis |
| Schritte pro Vorgang | 1 | 1 bis 3 | 5 bis 50 |
| Zugriff auf Systeme | keiner | lesend, teils schreibend | lesend und schreibend |
| Planung | nein | begrenzt | ja, zur Laufzeit |
| Selbstkorrektur | nein | selten | ja |
| Typischer Einsatz | FAQ auf Websites | Textentwürfe, Recherche | End-to-End-Prozesse |
KI-Assistenten sitzen genau dazwischen. Sie unterstützen einen Menschen bei seiner Arbeit, liefern Entwürfe für E-Mails, fassen Dokumente zusammen, beantworten Fragen zu internen Daten. Der Mensch bleibt der Taktgeber. Bei Agenten übernimmt das System den Takt, der Mensch kontrolliert. Für viele Abteilungen sind Assistenten der bessere erste Schritt, weil sie ohne Prozessumbau auskommen und weniger Angriffsfläche bieten.
Chatbots sind damit nicht überflüssig. Für standardisierte Fragen auf Websites, Öffnungszeiten, Versandkosten, Statusabfragen, sind einfache Chatbots schnell, billig und vorhersehbar. Der Fehler liegt darin, sie mit Aufgaben zu betrauen, die Planung erfordern.
Ist ChatGPT ein KI-Agent?
Nicht in seiner Grundform. Das Sprachmodell dahinter sagt Token für Token voraus, was als Nächstes kommt. Es plant nichts, ruft nichts auf, prüft nichts. Es ist die Denkmaschine, nicht der Agent.
Die Produktoberfläche hat sich allerdings verschoben. Sobald ChatGPT eigenständig im Web recherchiert, Code in einer Sandbox ausführt, Dateien analysiert oder über einen Browsermodus Websites bedient und dabei Cookie-Abfragen verarbeitet, erfüllt es die Kriterien: Es wählt Werkzeuge, führt mehrere Schritte aus und bewertet Zwischenergebnisse. In diesen Modi verhält es sich agentisch.
Die saubere Formulierung lautet deshalb: Das Modell ist kein Agent, das Produkt kann agentische Funktionen enthalten. Für Unternehmen ist diese Unterscheidung nicht akademisch. Wer einen Agenten für die eigene Auftragsabwicklung braucht, bekommt ihn nicht durch ein Abo, sondern durch die Anbindung an interne Systeme, definierte Werkzeuge, Rechte und Protokollierung. Das ist Entwicklungsarbeit, keine Konfiguration im Browser.
KI-Tools und Frameworks für die Entwicklung von KI-Agenten
Der Markt für KI-Tools rund um Agenten hat sich in zwei Lager sortiert. Auf der einen Seite Frameworks für Entwickler, auf der anderen No-Code-Plattformen für Fachabteilungen.
Im Entwicklerlager dominieren Open Source Bibliotheken. LangChain und das darauf aufbauende LangGraph modellieren Agenten als Graphen mit Zuständen und Übergängen, was Kontrolle über Schleifen und Abbruchbedingungen gibt. CrewAI und AutoGen sind auf Multi Agent Szenarien ausgelegt, mit Rollen, Aufgabenverteilung und Dialog zwischen Agenten. Das OpenAI Agents SDK und vergleichbare Angebote der großen Anbieter setzen stärker auf Integration ins eigene Ökosystem. Das Model Context Protocol hat sich als Standard etabliert, um Werkzeuge und Datenquellen anzubinden, ohne für jedes System eigenen Klebstoffcode zu schreiben.
Der Vorteil von Open Source liegt weniger im gesparten Lizenzpreis als in der Kontrolle: Man sieht, was in den Prompt geht, kann Modelle austauschen und auf eigener Infrastruktur betreiben. Für Branchen mit strengen Datenschutzanforderungen ist das oft ausschlaggebend.
Im No-Code-Lager stehen Plattformen wie n8n, Make oder Zapier mit KI-Bausteinen. Sie eignen sich hervorragend für klar umrissene Abläufe mit wenigen Verzweigungen. Die Grenze ist schnell erreicht, sobald ein Agent wirklich frei entscheiden soll. Dann kämpft man gegen die Oberfläche statt gegen das Problem.
Unabhängig vom Werkzeugkasten braucht jede Entwicklung von KI-Agenten drei Dinge, die gern vergessen werden: eine Testsuite mit realen Beispielfällen, ein Tracing-System, das jeden Schritt samt Kosten protokolliert, und ein Rechtekonzept, das festlegt, welche Daten der Agent sehen und welche Aktionen er auslösen darf.
Wie viel kostet ein KI-Agent?
Die Frage ist berechtigt und die Antwort besteht aus drei Blöcken.
Laufende Modellkosten. Ein Agentendurchlauf mit zehn bis fünfzehn Schritten verbraucht je nach Kontextgröße typischerweise 20.000 bis 100.000 Tokens. Bei aktuellen Preisen mittelgroßer Modelle liegt ein Lauf damit grob zwischen wenigen Cent und etwa einem Euro. Verarbeitet ein Agent täglich 300 E-Mails, entstehen monatliche Modellkosten im niedrigen bis mittleren dreistelligen Bereich. Günstigere Modelle für einfache Klassifikationsschritte senken das deutlich.
Einmalige Entwicklung. Ein klar abgegrenzter Agent mit zwei oder drei Systemanbindungen, Tests und Monitoring liegt bei externer Umsetzung erfahrungsgemäß zwischen 15.000 und 60.000 Euro. Multi Agent Systeme über mehrere Abteilungen hinweg landen schnell im sechsstelligen Bereich. No-Code-Lösungen für einen einzelnen Ablauf sind mit wenigen Tagen Aufwand machbar.
Betrieb und Pflege. Der am häufigsten unterschätzte Posten. Schnittstellen ändern sich, Websites bauen ihr Layout um, Modelle werden abgekündigt, Fachprozesse verschieben sich. Realistisch sind 15 bis 25 Prozent der Entwicklungskosten pro Jahr, dazu die Zeit der Mitarbeiter, die Ergebnisse kontrollieren.
Die entscheidende Rechnung ist nicht der Preis, sondern das Verhältnis zur eingesparten Bearbeitungszeit. Ein Agent, der 400 Vorgänge im Monat übernimmt und pro Vorgang sieben Minuten spart, ersetzt rund 47 Arbeitsstunden. Bleibt die Korrekturquote unter zehn Prozent, rechnet sich das in den meisten Fällen innerhalb eines Jahres.
KI-Agenten im Mittelstand: realistische Use Cases
Im Mittelstand scheitern Agentenprojekte selten an der Technik. Sie scheitern daran, dass der ausgewählte Anwendungsfall zu groß gedacht war. Wer gleich den gesamten Vertriebsinnendienst automatisieren will, produziert ein Projekt, das nach acht Monaten ohne Ergebnis eingestellt wird.
Gut funktionieren im Mittelstand Aufgaben mit hoher Wiederholung, klaren Regeln und tolerierbarem Fehlerrisiko:
- Angebotsvorbereitung. Der Agent liest Anfragen aus E-Mails, extrahiert Mengen, Artikelnummern und Liefertermine, prüft Preise im ERP und erzeugt einen Angebotsentwurf. Freigabe durch den Innendienst.
- Rechnungseingang. PDF-Rechnungen werden gelesen, mit Bestellungen abgeglichen, Abweichungen markiert. Nur Abweichungen landen auf dem Tisch eines Menschen.
- Support-Triage. Eingehende Tickets werden klassifiziert, angereichert und der richtigen Person zugewiesen. Einfache Fälle beantwortet der Agent direkt.
- Lieferantenrecherche. Ein Agent durchsucht Websites und Verzeichnisse nach Anbietern mit bestimmten Zertifikaten und erstellt eine Vergleichstabelle.
- Marketing-Routine. Produktdaten werden in Texte für Shop, Newsletter und Social Media übersetzt, in gleicher Struktur und Tonalität.
Im Marketing zeigt sich besonders deutlich, wo die Grenze verläuft. Die Erstellung von 200 Produktbeschreibungen nach festem Schema ist ein exzellenter Anwendungsfall. Eine Kampagnenstrategie ist es nicht, weil es keine prüfbare Zielfunktion gibt und die Qualität erst Monate später messbar wird.
Ein Hinweis zur Einführung im Mittelstand: Der erste Agent sollte in einem Bereich starten, in dem die Fachabteilung selbst Schmerzen hat und motiviert mitarbe