Warum ein Chatbot sicher klingt und trotzdem falschliegt
Eine flüssige Antwort fühlt sich schnell wie eine geprüfte Antwort an. Bei einem Sprachmodell sind das zwei verschiedene Dinge. Ein kleiner Prüfschritt hilft mehr als die Bitte, besonders gewissenhaft zu sein.

In diesem Artikel
Du fragst nach einer Funktion in einem Programm. Der Chatbot liefert eine passende Erklärung, drei Schritte und einen Namen für den Menüpunkt. Nur diesen Menüpunkt gibt es nicht. Der Rest klingt so ordentlich, dass du zuerst an dir selbst zweifelst.
Das Problem beginnt beim Lesen. Wir verwenden Form, Ton und Detailreichtum als Hinweise auf Kompetenz. Ein Sprachmodell kann diese Form erzeugen, ohne dass jede Aussage mit einer geprüften Fundstelle verbunden ist. „Sehr gern“ ist kein Qualitätsmerkmal. Eine sauber gesetzte Liste auch nicht.
Sprache erzeugen und Aussagen prüfen
Viele verbreitete Chatbots erzeugen ihre Antwort mit einem Sprachmodell, das aus dem verfügbaren Kontext eine Folge von Textbestandteilen bildet. Eine zusätzliche Suche oder ein Werkzeug kann diese Antwort mit Informationen versorgen. Ob eine solche Verbindung existiert und richtig funktioniert, hängt vom konkreten System ab. Aus dem sicheren Ton der Antwort lässt sich das nicht ablesen.
Für einen betrieblichen Bot ist deshalb die Frage entscheidend, ob eine Behauptung auf eine freigegebene Fundstelle zurückgeführt werden kann. Wie das aussehen kann, zeigt unser Leitfaden für einen FAQ-Bot mit nachschlagbaren Antworten. Eine Quellenanzeige ist hilfreich, aber sie muss tatsächlich zur Aussage passen. Ein erfundener Titel macht den Fehler nur dekorativer.
Das BSI-Papier zu generativen KI-Modellen behandelt Risiken solcher Systeme. Für unsere Arbeit heißt das: Antworten werden als prüfbedürftige Ausgaben behandelt, nicht als Belege ihrer eigenen Richtigkeit.
Drei Stationen: Eingabe, erzeugter Text, unabhängige Prüfung
Die Eingabe erreicht das Sprachmodell. Von dort führen zwei Wege weiter: Der obere endet an einer leeren Platte ohne Belegstelle, der untere läuft durch eine Prüfstelle und erreicht drei nachschlagbare Fundstellen. Nur der untere Weg ist im Betrieb verwendbar.
- geprüfte Verbindung
- Verbindung ohne Beleg
Schematische Darstellung
Das Schema zeigt einen typischen Aufbau, kein Verhalten eines bestimmten Produkts. Ob ein System tatsächlich nachschlagbare Fundstellen liefert, muss am konkreten Aufbau geprüft werden.
Prüfe zuerst das, was Folgen hat
Bei einer Ideensammlung kann ein schiefer Vorschlag wenig kosten. Bei einer Frist, einer Rechnungsnummer oder einer technischen Einstellung kann ein einzelnes falsches Detail den ganzen Vorgang verändern. Markiere deshalb die Teile, die jemand übernehmen oder ausführen würde. Prüfe diese am Original: Ist die Frist dort genannt? Gilt die Anleitung für die vorhandene Version? Existiert der angeführte Menüpunkt?
Gib dem Bot nicht mehr Rechte, nur weil sein Text überzeugend klingt. Eine Antwort und eine ausgeführte Aktion brauchen getrennte Freigaben. Unser Leitfaden zu begrenzten Bot-Rechten erklärt diese Grenze anhand kleiner Aufgaben.
Wiederhole außerdem dieselbe Frage mit einigen klaren Varianten. Ein einzelner guter Durchlauf sagt wenig über den späteren Betrieb. Bei der Auswertung helfen absolute Fehlerzahlen und die Art des Fehlers mehr als ein hübscher Durchschnitt. Warum eine mittlere Zahl das falsche Bild liefern kann, steht im Beitrag über Durchschnitt und Ausreißer.
Vom guten Satz zum brauchbaren Ablauf
Wenn eine Antwort in eine Automatisierung fließt, wird ihr Fehler weitertransportiert. Ein falscher Termin kann in einer Aufgabenliste landen, ein falsch erkannter Name in einer Nachricht. Im E-Mail-zu-Aufgabe-Beispiel bleibt deshalb eine prüfbare Vorschau zwischen Eingang und Ausführung. Der Bot darf vorschlagen; die verbindliche Aktion folgt erst nach dem vorgesehenen Kontrollschritt.
Auch ein korrektes Ergebnis kann zweimal ausgeführt werden. Das Sprachmodell muss dafür nicht falsch antworten. Ein Zustellversuch kann wiederholt werden, während das Zielsystem schon gearbeitet hat. Der Artikel über doppelte Bot-Aufträge beschreibt diesen anderen Fehlertyp. Inhalt prüfen und Ausführung absichern sind zwei separate Aufgaben.
Ob der Ablauf auf einem eigenen Server oder bei einem Anbieter liegt, löst die Frage nach richtigen Antworten ebenfalls nicht. Das Betriebsmodell verändert Zuständigkeiten und technische Möglichkeiten. Unser Vergleich von Cloud und eigenem Server hilft, diese Arbeit zu verteilen, ohne aus dem Hosting eine Wahrheitsgarantie zu machen.
Ein brauchbarer Abbruch ist ein Ergebnis
Ein Bot sollte sagen können, dass eine Information fehlt. Das ist besonders dann brauchbar, wenn der nächste Schritt bekannt ist: eine konkrete Fundstelle öffnen, eine zuständige Person nennen oder den Entwurf zur Prüfung zurückgeben. „Ich weiß es nicht“ ohne Rückweg ist unpraktisch. Eine erfundene Antwort mit drei Ausrufezeichen ist schlimmer.
Teste deshalb nicht nur Fragen, auf die das System antworten soll. Teste auch veraltete Dokumente, widersprüchliche Angaben und Fragen außerhalb seines Auftrags. Die gewünschte Antwort kann dann eine Übergabe sein. Sie lässt sich prüfen, und niemand muss dafür an den Tonfall glauben.
Quellen und weiterführende Lektüre
Quellen und weiterführende Lektüre
Bundesamt für Sicherheit in der Informationstechnik: „Generative KI-Modelle“. Der öffentliche Quellenlink steht einmal im Text. Die praktischen Beispiele dieses Beitrags sind schematisch und keine dokumentierten Produkttests.
Bundesamt für Sicherheit in der Informationstechnik: „Generative KI-Modelle“. Verlinkt an der genannten Stelle im Text.
Prüfprotokoll: docs/research/A01.md, öffentlicher Link E01
Die praktischen Beispiele dieses Beitrags sind schematisch und keine dokumentierten Produkttests.
Prüfprotokoll: docs/research/A01.md, kein öffentlicher Link
Schlagwörter
- Sprachmodell
- Halluzination
- Quellenprüfung
- Token
- Prompt
- Prüfschritt
Weiterlesen
Auch rückblickende Modelle können überzeugender aussehen, als sie sind: Ein Backtest ist noch kein funktionierender Trading-Bot.