AI-Designers
Eine Sachbearbeiterin fragt Ihr KI-System: „Welche unserer Lieferantenverträge laufen im vierten Quartal aus, und welche davon enthalten eine automatische Verlängerungsklausel?“ Klassische RAG-Systeme schlagen bei so einer Frage fehl. Sie suchen einmal, finden ein paar halbwegs passende Textstellen und raten den Rest zusammen. Agentische RAG geht anders vor: Sie zerlegt die Frage, sucht mehrfach, prüft ihre eigenen Zwischenergebnisse und antwortet erst, wenn die Belege stimmen.
Warum klassische RAG an ihre Grenzen stößt
Die erste Generation von RAG-Systemen folgt einem starren Ablauf. Eine Frage kommt herein, das System wandelt sie in einen Vektor um, holt die fünf oder zehn ähnlichsten Textabschnitte aus der Datenbank und reicht sie zusammen mit der Frage an das Sprachmodell weiter. Ein Durchlauf, eine Suche, eine Antwort. Bei einfachen Fragen funktioniert das erstaunlich gut.
Sobald eine Frage aber mehrere Teilaspekte hat, bricht das Modell ein. Unsere Vertragsfrage besteht eigentlich aus zwei Suchen: Welche Verträge laufen im Q4 aus? Und: Welche davon verlängern sich automatisch? Eine einzelne Vektorsuche vermischt beide Absichten und liefert einen Kompromiss, der keine der beiden Fragen sauber trifft. Das Sprachmodell füllt die Lücken dann mit plausibel klingenden Erfindungen. Genau diese Fälle landen später als Beschwerde auf dem Tisch.
Das Problem ist nicht das Modell, sondern der Ablauf. Ein Mensch würde bei so einer Frage auch nicht ein einziges Mal ins Regal greifen. Er sucht die auslaufenden Verträge, legt sie beiseite und prüft dann jeden einzeln auf die Verlängerungsklausel. Agentische RAG bildet genau dieses Vorgehen nach.
Was agentische RAG anders macht
Der Kern ist ein Steuerungsmodell, das die Suche selbst in die Hand nimmt. Statt stur einmal abzurufen, plant es. Es zerlegt die Frage in Teilschritte, formuliert eigene Suchanfragen, bewertet die Treffer und entscheidet, ob es genug weiß oder noch einmal nachschlagen muss. Erst am Ende schreibt es die Antwort.
Vier Bausteine machen den Unterschied. Der Planer teilt komplexe Fragen in beantwortbare Häppchen. Der Retriever führt pro Häppchen eine eigene Suche aus, oft über mehrere Quellen – die Vertragsdatenbank, das Wiki, die Tickethistorie. Ein Bewerter prüft, ob die gefundenen Belege die Teilfrage wirklich stützen, und wirft schwache Treffer raus. Und eine Schleife erlaubt dem System, bei Lücken noch einmal loszuziehen, statt vorschnell zu antworten.
Wichtig für Ihre Infrastruktur: Dieses Vorgehen hängt nicht an einem bestimmten Anbieter. Sie können es vollständig auf offenen Modellen und im eigenen Rechenzentrum betreiben. Das Steuerungsmodell muss kein Riese sein – ein solide feinjustiertes Modell im Bereich von sieben bis vierzehn Milliarden Parametern plant zuverlässig genug, solange die Werkzeuge und die Datenqualität stimmen.

Ein Beispiel aus der Praxis: die mehrteilige Frage
Bleiben wir bei den Verträgen. Ein klassisches System sucht einmal nach „Verträge Q4 Verlängerung“ und hofft auf das Beste. Ein agentisches System geht in Etappen vor. Zuerst sucht es gezielt nach Verträgen mit Enddatum im vierten Quartal und findet, sagen wir, dreiundzwanzig Treffer. Dann prüft es diese dreiundzwanzig Stück für Stück auf den Passus zur automatischen Verlängerung – jeweils mit einer eigenen, engen Suche im Volltext des jeweiligen Vertrags.
Am Ende steht keine vage Zusammenfassung, sondern eine Liste: acht Verträge, jeder mit Nummer, Enddatum und dem konkreten Klauselzitat als Beleg. Wer die Antwort prüft, klickt sich direkt zur Quelle durch. Diese Nachvollziehbarkeit ist für regulierte Branchen kein Bonus, sondern Voraussetzung.
Der Gewinn zeigt sich vor allem bei Vergleichen und Bedingungen. „Zeig mir Abweichungen zwischen der Version von März und der aktuellen Fassung“ oder „Welche Störungen der letzten Woche betrafen dieselbe Baugruppe?“ – solche Fragen erfordern mehrere Blicke in unterschiedliche Dokumente. Genau dort spielt der agentische Ansatz seine Stärke aus.
Wo Unternehmen den Unterschied merken
Im Kundenservice beantwortet ein agentisches System auch verschachtelte Anfragen, bei denen Vertragsstatus, Produktdokumentation und frühere Tickets zusammenkommen. Der Mitarbeiter im ersten Level bekommt eine belegte Antwort statt einer Ahnung und muss seltener eskalieren.
In der Rechts- und Compliance-Arbeit zählt jede Quelle. Ein Team, das hundert Rahmenverträge auf eine bestimmte Haftungsklausel prüfen muss, spart Tage – und behält trotzdem die volle Kontrolle, weil jede Aussage auf eine konkrete Textstelle zeigt. In der Fertigung hilft derselbe Mechanismus, wenn eine Störungsmeldung mit Wartungshistorie, Handbuch und Ersatzteilkatalog abgeglichen werden muss, bevor jemand den Schlüssel in die Hand nimmt.
Auch die Finanzabteilung profitiert. Fragen wie „Wie hat sich unsere Rohmarge über die letzten vier Quartale entwickelt, aufgeschlüsselt nach Sparte?“ verlangen mehrere Abrufe aus getrennten Berichten. Ein einzelner Vektortreffer kann das nicht leisten. Ein planendes System schon.

Der Preis: Latenz, Kosten, Kontrolle
Ehrlich bleiben gehört dazu: Agentische RAG kostet mehr. Mehrere Suchläufe und Prüfschritte bedeuten mehr Rechenzeit pro Antwort. Wo ein klassisches System nach zwei Sekunden fertig ist, braucht ein agentischer Ablauf schon mal sechs oder acht. Für einen Chat, in dem der Nutzer wartet, kann das zu lang sein. Für eine gründliche Vertragsprüfung, die sonst einen halben Tag dauert, ist es ein Schnäppchen.
Deshalb lautet die Regel: nicht alles agentisch machen. Leiten Sie einfache Fragen weiter an den schnellen Einmal-Abruf und heben Sie den aufwendigen Ablauf für die komplexen Fälle auf. Ein kleines Klassifikationsmodell am Eingang entscheidet in Millisekunden, welchen Weg eine Anfrage nimmt. So zahlen Sie die höheren Kosten nur dort, wo sie sich lohnen.
Wer im eigenen Haus betreibt, hat hier einen echten Hebel. Sie sehen jeden Suchlauf, jeden Zwischenschritt und jede Kostenstelle. Sie können die Schleifen begrenzen, ein Zeitbudget setzen und Ausreißer abfangen, bevor ein Agent sich in zwanzig Suchen verrennt. Diese Kontrolle geben Sie bei einer geschlossenen Cloud-API aus der Hand.
So starten Sie ohne Überengineering
Bauen Sie nicht sofort das große Orchester. Fangen Sie mit einer sauberen klassischen RAG an und messen Sie, welche Fragen daran scheitern. Meist zeigt sich schnell ein Muster: die mehrteiligen, die vergleichenden, die bedingten Fragen. Genau die geben Sie als Erstes an einen agentischen Ablauf.
Erweitern Sie dann in kleinen Schritten. Zuerst die Zerlegung mehrteiliger Fragen. Danach der Bewerter, der schwache Treffer aussortiert. Zuletzt die Nachschlage-Schleife mit hartem Limit. Messen Sie nach jedem Schritt an echten Fragen aus Ihrem Betrieb, nicht an Demobeispielen. Ein System, das im Labor glänzt und im Alltag danebenliegt, kostet Sie Vertrauen – und das holen Sie schwer zurück.
Sie möchten prüfen, ob agentische RAG für Ihre Dokumente und Ihren Betrieb den Unterschied macht? Wir bei AI-Designers planen und betreiben selbst-gehostete KI-Systeme im eigenen Rechenzentrum – von der ersten Machbarkeitsprüfung bis zum produktiven Einsatz. Sprechen Sie mit uns über Ihren konkreten Anwendungsfall.
Bilder: AI-Designed
English

