Quantix & Bot
ErklärtChatbots

Warum ein Chatbot sicher klingt und trotzdem falschliegt

Eine flüssige Antwort fühlt sich schnell wie eine geprüfte Antwort an. Bei einem Sprachmodell sind das zwei verschiedene Dinge. Ein kleiner Prüfschritt hilft mehr als die Bitte, besonders gewissenhaft zu sein.

Zwei Sprechmodule senden ein Signal. Eines endet an einer leeren Platte, das andere erreicht nach einer Prüfstelle drei geordnete Belegplatten.
Zwei Sprechmodule senden ein Signal. Eines endet an einer leeren Platte, das andere erreicht nach einer Prüfstelle drei geordnete Belegplatten. Illustration / Grafik: Redaktion Quantix & Bot.
In diesem Artikel

Du fragst nach einer Funktion in einem Programm. Der Chatbot liefert eine passende Erklärung, drei Schritte und einen Namen für den Menüpunkt. Nur diesen Menüpunkt gibt es nicht. Der Rest klingt so ordentlich, dass du zuerst an dir selbst zweifelst.

Das Problem beginnt beim Lesen. Wir verwenden Form, Ton und Detailreichtum als Hinweise auf Kompetenz. Ein Sprachmodell kann diese Form erzeugen, ohne dass jede Aussage mit einer geprüften Fundstelle verbunden ist. „Sehr gern“ ist kein Qualitätsmerkmal. Eine sauber gesetzte Liste auch nicht.

Sprache erzeugen und Aussagen prüfen

Viele verbreitete Chatbots erzeugen ihre Antwort mit einem Sprachmodell, das aus dem verfügbaren Kontext eine Folge von Textbestandteilen bildet. Eine zusätzliche Suche oder ein Werkzeug kann diese Antwort mit Informationen versorgen. Ob eine solche Verbindung existiert und richtig funktioniert, hängt vom konkreten System ab. Aus dem sicheren Ton der Antwort lässt sich das nicht ablesen.

Für einen betrieblichen Bot ist deshalb die Frage entscheidend, ob eine Behauptung auf eine freigegebene Fundstelle zurückgeführt werden kann. Wie das aussehen kann, zeigt unser Leitfaden für einen FAQ-Bot mit nachschlagbaren Antworten. Eine Quellenanzeige ist hilfreich, aber sie muss tatsächlich zur Aussage passen. Ein erfundener Titel macht den Fehler nur dekorativer.

Das BSI-Papier zu generativen KI-Modellen behandelt Risiken solcher Systeme. Für unsere Arbeit heißt das: Antworten werden als prüfbedürftige Ausgaben behandelt, nicht als Belege ihrer eigenen Richtigkeit.

Drei Stationen: Eingabe, erzeugter Text, unabhängige Prüfung

Die Eingabe erreicht das Sprachmodell. Von dort führen zwei Wege weiter: Der obere endet an einer leeren Platte ohne Belegstelle, der untere läuft durch eine Prüfstelle und erreicht drei nachschlagbare Fundstellen. Nur der untere Weg ist im Betrieb verwendbar.

TexteingabeSprachmodell erzeugt Textkeine BelegstellePrüfstelledrei Fundstellen
  • geprüfte Verbindung
  • Verbindung ohne Beleg

Schematische Darstellung

Das Schema zeigt einen typischen Aufbau, kein Verhalten eines bestimmten Produkts. Ob ein System tatsächlich nachschlagbare Fundstellen liefert, muss am konkreten Aufbau geprüft werden.

Prüfe zuerst das, was Folgen hat

Bei einer Ideensammlung kann ein schiefer Vorschlag wenig kosten. Bei einer Frist, einer Rechnungsnummer oder einer technischen Einstellung kann ein einzelnes falsches Detail den ganzen Vorgang verändern. Markiere deshalb die Teile, die jemand übernehmen oder ausführen würde. Prüfe diese am Original: Ist die Frist dort genannt? Gilt die Anleitung für die vorhandene Version? Existiert der angeführte Menüpunkt?

Gib dem Bot nicht mehr Rechte, nur weil sein Text überzeugend klingt. Eine Antwort und eine ausgeführte Aktion brauchen getrennte Freigaben. Unser Leitfaden zu begrenzten Bot-Rechten erklärt diese Grenze anhand kleiner Aufgaben.

Wiederhole außerdem dieselbe Frage mit einigen klaren Varianten. Ein einzelner guter Durchlauf sagt wenig über den späteren Betrieb. Bei der Auswertung helfen absolute Fehlerzahlen und die Art des Fehlers mehr als ein hübscher Durchschnitt. Warum eine mittlere Zahl das falsche Bild liefern kann, steht im Beitrag über Durchschnitt und Ausreißer.

Vom guten Satz zum brauchbaren Ablauf

Wenn eine Antwort in eine Automatisierung fließt, wird ihr Fehler weitertransportiert. Ein falscher Termin kann in einer Aufgabenliste landen, ein falsch erkannter Name in einer Nachricht. Im E-Mail-zu-Aufgabe-Beispiel bleibt deshalb eine prüfbare Vorschau zwischen Eingang und Ausführung. Der Bot darf vorschlagen; die verbindliche Aktion folgt erst nach dem vorgesehenen Kontrollschritt.

Auch ein korrektes Ergebnis kann zweimal ausgeführt werden. Das Sprachmodell muss dafür nicht falsch antworten. Ein Zustellversuch kann wiederholt werden, während das Zielsystem schon gearbeitet hat. Der Artikel über doppelte Bot-Aufträge beschreibt diesen anderen Fehlertyp. Inhalt prüfen und Ausführung absichern sind zwei separate Aufgaben.

Ob der Ablauf auf einem eigenen Server oder bei einem Anbieter liegt, löst die Frage nach richtigen Antworten ebenfalls nicht. Das Betriebsmodell verändert Zuständigkeiten und technische Möglichkeiten. Unser Vergleich von Cloud und eigenem Server hilft, diese Arbeit zu verteilen, ohne aus dem Hosting eine Wahrheitsgarantie zu machen.

Ein brauchbarer Abbruch ist ein Ergebnis

Ein Bot sollte sagen können, dass eine Information fehlt. Das ist besonders dann brauchbar, wenn der nächste Schritt bekannt ist: eine konkrete Fundstelle öffnen, eine zuständige Person nennen oder den Entwurf zur Prüfung zurückgeben. „Ich weiß es nicht“ ohne Rückweg ist unpraktisch. Eine erfundene Antwort mit drei Ausrufezeichen ist schlimmer.

Teste deshalb nicht nur Fragen, auf die das System antworten soll. Teste auch veraltete Dokumente, widersprüchliche Angaben und Fragen außerhalb seines Auftrags. Die gewünschte Antwort kann dann eine Übergabe sein. Sie lässt sich prüfen, und niemand muss dafür an den Tonfall glauben.

Quellen und weiterführende Lektüre

Quellen und weiterführende Lektüre

Bundesamt für Sicherheit in der Informationstechnik: „Generative KI-Modelle“. Der öffentliche Quellenlink steht einmal im Text. Die praktischen Beispiele dieses Beitrags sind schematisch und keine dokumentierten Produkttests.

  • Bundesamt für Sicherheit in der Informationstechnik: „Generative KI-Modelle“. Verlinkt an der genannten Stelle im Text.

    Prüfprotokoll: docs/research/A01.md, öffentlicher Link E01

  • Die praktischen Beispiele dieses Beitrags sind schematisch und keine dokumentierten Produkttests.

    Prüfprotokoll: docs/research/A01.md, kein öffentlicher Link

Schlagwörter

  • Sprachmodell
  • Halluzination
  • Quellenprüfung
  • Token
  • Prompt
  • Prüfschritt

Auch rückblickende Modelle können überzeugender aussehen, als sie sind: Ein Backtest ist noch kein funktionierender Trading-Bot.

Zum Datenschutz

Wir verwenden zum Start keine Analyse- oder Werbedienste. Schriftdateien, Bilder und die Suche kommen von unserem eigenen Webhosting. Details findest du in den Datenschutzinformationen.

Datenschutz ansehenImpressum