Wenn die KI die falsche Fassung findet
04.10.2026·5 Min. Lesezeit·von David Paci

Bild KI-generiert
Wer eine Rechtsfrage zu einem bestimmten Zeitpunkt beantworten will, braucht die Fassung, die damals gegolten hat. Das klingt selbstverständlich, wird bei KI-Wissenssystemen aber schnell zum Problem. Viele Systeme suchen vor allem danach, welche Textstellen einer Frage inhaltlich am ähnlichsten sind. Ob ein gefundener Text im Jahr 2019, 2023 oder heute gültig war, spielt bei dieser Suche zunächst keine Rolle.
Bei einem Gesetz, das über Jahre unverändert bleibt, fällt das kaum auf. Schwieriger wird es bei Vorschriften, Verträgen oder internen Richtlinien, die regelmäßig überarbeitet werden. Zwei Fassungen können sprachlich fast identisch sein und sich trotzdem an einer Stelle unterscheiden, die für die Antwort wesentlich ist.
Ein System kann damit einen authentischen Gesetzestext zitieren und trotzdem die falsche Rechtslage wiedergeben.
Wie deutlich dieser Effekt ausfallen kann, haben Rose Cymbler, Daniel Guez und Laurent Fabre 2026 anhand des französischen Steuerrechts untersucht. Ihre Studie „Temporal Misgrounding in Legal RAG: A Versioned-Corpus Benchmark for French Tax Law“ umfasst 32.436 Fassungen von Artikeln des französischen Steuergesetzbuchs aus einem Zeitraum von 93 Jahren. Für den Test wurden 209 fachlich geprüfte Fragen zu 33 Gesetzesartikeln verwendet.
Das Ergebnis fällt deutlich aus. Ohne Dokumentensuche beantworteten die getesteten Sprachmodelle im Durchschnitt 3,0 Prozent der Fragen richtig. Mit einer herkömmlichen Suche über die aktuellen Gesetzestexte waren es 2,7 Prozent. Bei keiner einzigen Frage fand diese Suche jene Fassung, die zum abgefragten Zeitpunkt tatsächlich anzuwenden war.
Die zusätzliche Dokumentensuche brachte in diesem Aufbau also keinen Vorteil. Sie stellte dem Sprachmodell Texte zur Verfügung, die zur Frage passten, aber aus dem falschen Zeitraum stammten.
Eine Suche nach Inhalt kennt noch keinen Stichtag
Hinter vielen KI-Wissenssystemen steckt eine Vektorsuche. Dabei wird nicht ausschließlich nach identischen Begriffen gesucht. Das System versucht auch Textstellen zu finden, die inhaltlich zur Anfrage passen.
Für frei formulierte Fragen ist dieses Verfahren nützlich. Ein Mitarbeiter kann beispielsweise nach „Kündigung während der Probezeit“ fragen, obwohl im Dokument eine andere Formulierung verwendet wird.
Bei verschiedenen Fassungen desselben Dokuments entsteht jedoch ein Problem. Eine alte und eine neue Version liegen inhaltlich meist sehr nahe beieinander. Wurde lediglich eine Frist von sechs auf acht Wochen geändert, bleiben fast alle anderen Wörter gleich. Für die Ähnlichkeitssuche sind daher beide Texte plausible Treffer.
Der Gültigkeitszeitraum steckt in dieser Ähnlichkeit nicht automatisch mit drin.
Das betrifft auch Dokumente außerhalb des Rechts. Verträge werden durch Nachträge verändert, interne Richtlinien neu aufgelegt und technische Normen in neuen Ausgaben veröffentlicht. Sobald sich eine Frage auf einen früheren Zeitpunkt bezieht, muss das System erkennen können, welche Version damals gegolten hat.
Ein versionierter Index verändert das Ergebnis
Die Autoren der französischen Studie haben deshalb einen zweiten Ansatz getestet. Dabei enthält der Suchindex nicht nur aktuelle Texte, sondern sämtliche erfassten Fassungen mit ihrer zeitlichen Gültigkeit.
Mit diesem Aufbau stieg der Anteil richtiger Antworten laut „Temporal Misgrounding in Legal RAG“ auf 98,3 Prozent.
Der Unterschied entstand bereits bei der Auswahl der Quellen. Das Sprachmodell erhielt für die jeweilige Frage jene Gesetzesfassung, die zum genannten Stichtag gehörte.
Für den Aufbau eines Wissenssystems bedeutet das, dass Versionen als eigene Information behandelt werden müssen. Beim Einlesen eines Dokuments lässt sich beispielsweise speichern, ab welchem Datum eine Fassung gilt und wann sie durch eine neue ersetzt wurde. Enthält die spätere Anfrage einen Stichtag, kann der Dokumentenbestand zunächst nach diesem Zeitraum gefiltert werden. Erst innerhalb dieser Auswahl beginnt die inhaltliche Suche.
Eine Untersuchung aus dem September 2026 kommt bei sich überschneidenden und laufend veränderten Dokumenten zu einem ähnlichen Ergebnis. Die Autoren von „TimelyRAG: Semantic-Temporal Hybrid Retrieval for Time-Critical Question Answering in Overlapping-Evolving Documents“ beziehen neben der semantischen Ähnlichkeit auch zeitliche Informationen in die Sortierung der Treffer ein. Bei regelmäßig geänderten Regelwerken verbesserte sich die Qualität der Trefferreihenfolge dabei um bis zu 28,6 Prozent, gemessen mit nDCG@10.
Diese Messgröße bewertet, wie gut relevante Treffer in einer Ergebnisliste platziert sind. Für ein Wissenssystem ist das deshalb wichtig, weil das Sprachmodell in der Regel nur einen begrenzten Teil der gefundenen Dokumente zur Beantwortung erhält.
Alte Versionen müssen auffindbar bleiben
In normalen Dateiablagen ist häufig die aktuelle Version am leichtesten zu finden. Für viele Arbeitsabläufe ist das sinnvoll. Bei historischen Fragen reicht es allerdings nicht.
Ein Beispiel ist eine interne Richtlinie, deren Reisekostensätze mehrfach geändert wurden. Wer wissen möchte, welcher Satz für eine Abrechnung aus dem Jahr 2022 galt, braucht die damalige Version. Dass inzwischen ein neuer Betrag gilt, ist für diese Frage unerheblich.
Ähnliches gilt für Verträge. Ein Nachtrag kann einzelne Passagen ersetzen, ohne dass der ursprüngliche Vertrag vollständig neu geschrieben wird. Bei einer späteren Prüfung muss deshalb nachvollziehbar bleiben, welcher Stand zu einem bestimmten Zeitpunkt maßgeblich war.
Ein KI-Wissenssystem benötigt dafür mehr als eine Sammlung aktueller Dateien. Die zeitliche Beziehung zwischen den einzelnen Fassungen muss beim Aufbau des Datenbestands erhalten bleiben.
In unserem Artikel über die Genauigkeit von KI-Wissenssystemen ist der Zeitbezug deshalb eine eigene Fehlerstelle. Eine pauschale Trefferquote zeigt dieses Problem nur unzureichend, weil die Antwort sprachlich sauber sein und gleichzeitig auf einer falschen Fassung beruhen kann.
Ein einfacher Test für das eigene Wissenssystem
Ob ein vorhandenes System mit diesem Problem umgehen kann, lässt sich mit einem bekannten Versionswechsel prüfen.
Dafür eignet sich ein Vertrag, eine Richtlinie oder ein anderes Dokument, von dem mehrere Fassungen existieren. Stelle eine Frage, die sich ausdrücklich auf einen früheren Stichtag bezieht, und prüfe anschließend die zitierte Quelle. Entscheidend ist, ob tatsächlich die damals gültige Version verwendet wurde.
Bei der Auswahl oder Prüfung eines Systems lohnt sich außerdem die Frage, wie der Gültigkeitszeitraum technisch erfasst wird. Ein Datum im Dateinamen hilft dabei nur eingeschränkt. Für eine zuverlässige zeitliche Suche sollte die Version als strukturierte Information im Dokumentenbestand vorhanden sein.
Häufige Fragen
Reicht es, alte Dokumente einfach mitzuspeichern?
Nein. Sie müssen auch einem Zeitraum zugeordnet werden können. Andernfalls findet die Suche zwar mehrere Fassungen, weiß aber nicht, welche davon zu einem bestimmten Stichtag gehört.
Kann ein Sprachmodell den richtigen Zeitraum selbst erkennen?
Ein Sprachmodell kann eine Zeitangabe in der Frage erkennen. Das hilft allerdings nur, wenn auch die Dokumente Informationen über ihre Gültigkeit enthalten und die Suche diese Angaben verwendet.
Wo tritt das Problem besonders häufig auf?
Überall dort, wo ältere Fassungen weiterhin relevant bleiben. Typische Beispiele sind Gesetze und Verträge sowie regelmäßig überarbeitete interne oder technische Vorgaben.
Du möchtest wissen, wie dein Wissenssystem mit Stichtagen und Versionen umgeht? Wir testen das in einem technischen Audit. Sprich mit uns.
Autor