← Alle Artikel

A. „Ein LLM erklärt nicht, es optimiert sprachliche Kohärenz“1

Wahl nennt in seinem Artikel über das informationswissenschaftliche Grundgerüst von RAG-Systemen einen sehr interessanten Ansatz. Danach müsse dem jeweiligen Nutzer in der Praxis bewusst sein, dass ein LLM nicht im übertragbaren Sinn erklärt, sondern auf Grundlage erlernter Muster Ausgaben erzeugt. Die Formulierung, dass ein LLM optimiert, sollte daher nicht technisch verstanden werden. Diese Formulierung ist passend, um die Funktionalität nachvollziehen zu können.

Sprachliche Kohärenz2 bezeichnet in der Linguistik den inhaltlichen und logischen Zusammenhang eines Textes. Damit eng verbunden ist die Kohäsion3, die äußerliche Verknüpfung von Sätzen und Satzteilen. Dem Nutzer entgeht dabei im Rahmen der täglichen Anwendung, dass ein LLM nur denjenigen Output wiedergibt, den es anhand des Kontexts, des Prompts und der Modellparameter für wahrscheinlich hält. Das bedeutet konkret, dass ein Text oder ein Ergebnis ausgegeben werden kann, dessen Zusammenhang auf den ersten Blick nachvollziehbar erscheint, obwohl Schlussfolgerungen fehlerhaft sind. Sprachliche Kohärenz und Kohäsion kann ein LLM insofern berücksichtigen und in seiner Ausgabe überzeugend reproduzieren. Die Qualität eines Textes bestimmt sich allerdings nicht nur nach diesen Gesichtspunkten. Vielmehr ist insbesondere im juristischen Kontext der Fokus auf juristische Präzision zu legen.4

B. Retrieval-Augmented Generation (RAG)

Technische Innovation schreitet insbesondere im Bereich generativer KI schnell voran. In diesem Zusammenhang ist auf das Retrieval-Augmented Generation (RAG) einzugehen. Ein LLM beruht auf Machine Learning.5 Das führt häufig dazu, dass bestehende parametrische Informationen an die Trainingsdaten gebunden sind und veraltet oder irrelevant sein können.

Vereinfacht gesagt bedeutet der Einsatz von RAG, dass bei einer Abfrage weitere Wissensquellen zur Verfügung gestellt werden. Dadurch kann die faktische Fundierung und das Problem der Halluzination verbessert werden. An dieser Stelle sollte angemerkt werden, dass auch hier das Problem der Halluzination nicht gänzlich beseitigt werden kann. Ein fehlerhaftes Retrieval kann zu falschen Angaben führen.6

Es handelt sich dabei um eine Verbindung von Informationsretrieval und generativer Sprachverarbeitung. Das wird auch als cross-reference bezeichnet.7 Gemeint ist vereinfacht eine Erschließung von Wissensquellen, die häufig semantisch oder lexikalisch erfolgt. Dabei werden Dokumente indexiert und relevante Inhalte bei einer Anfrage abgerufen, um dem LLM zusätzlichen Kontext zur Verfügung zu stellen. RAG-Systeme werden unter anderem für wissensintensive Anwendungen diskutiert und eingesetzt, beispielsweise in medizinischen, juristischen oder sonstigen Compliance Kontexten.7

C. Folgerung für den juristischen Kontext

I. KI im Justizsystem

Mit der zunehmenden Verfügbarkeit generativer KI stellt sich auch für die Justiz die Frage, wie mit zumindest teilweise KI-generierten Schriftsätzen umzugehen ist. Der Hintergrund ist nachvollziehbar. Juristische Texte sind für einen juristischen Laien oft schwierig nachzuvollziehen, insbesondere aufgrund ihrer Verweisungen, Zusammenhänge und Interpretationen. Nun kann man sich des Mittels generativer KI bedienen, um innerhalb kurzer Zeit umfangreiche Schriftsätze erstellen zu lassen.

Freilich fällt dem Juristen in solchen generierten Schriften auf, dass manche Normzitate falsch sind, Ansprüche so nicht hergeleitet werden können oder Urteile, auf die verwiesen wurde, gar nicht existieren. An der Stelle ist auf das Problem der Halluzination hinzuweisen, das eingangs in dieser Reihe bereits behandelt wurde. Logischerweise ist an dieser Stelle anzumerken, dass sich die Leistungsfähigkeit der LLMs stetig verbessert. Dies ändert jedoch nichts daran, dass die rechtliche Tragfähigkeit eines generierten Schriftsatzes im Einzelfall geprüft werden muss.

Jedem Bürger steht gegen die öffentliche Gewalt das Grundrecht des effektiven Rechtsschutzes (Art. 19 IV GG) sowie der Anspruch auf einen gesetzlichen Richter zu (Art. 101 I 2 GG). Der allgemeine Justizgewährungsanspruch folgt dabei aus dem Rechtsstaatsprinzip aus Art. 20 III GG. Historisch ist die sogenannte Denegatio iustitiae zu erwähnen, das heißt das Verbot der Rechtsverweigerung.8 Diese Entwicklungen können daher die Entstehung eines Spannungsfeldes aufweisen. Es ist durchaus positiv zu werten, dass das Recht unter Zuhilfenahme von KI einer größeren Zahl von Bürgern leichter zugänglich gemacht werden kann. Eine größere Anzahl von Bürgern könnte von diesem Recht wieder Gebrauch machen. Dabei muss berücksichtigt werden, dass die Zahl der Neuzugänge und anhängigen Verfahren in Zivilsachen vor dem Amtsgericht in den letzten Jahren im Durchschnitt gesunken ist, zuletzt jedoch wieder gestiegen ist.9 Unabhängig davon darf nicht außer Acht gelassen werden, dass zahlreiche Gerichte und Staatsanwaltschaften, etwa in Strafsachen, mit tausenden Fällen bereits bereits einer erheblichen Arbeitsbelastung ausgesetzt sind.10 Eine höhere Zahl KI-generierter Klagen schafft daher neue Herausforderungen für die Justiz.

II. Potenzial

Es ist zu untersuchen, wie die genannten Grundsätze im Kontext der juristischen Tätigkeit konkret einzuordnen sind. Es wurde bisher aufgezeigt, dass ein sachgerechter Einsatz generativer KI sowohl Informationskompetenz als auch ein zumindest grundlegendes Verständnis ihrer Funktionsweise voraussetzt. Ein Potenzial kann nur da ausgereizt werden, wo ein Anhaltspunkt besteht, die Grundlage nachzuvollziehen. In der Literatur und in öffentlichen Diskursen wird die mögliche Gefahr für den Verlust des anwaltlichen Berufs prognostiziert. Es wird teilweise aufgezeigt, dass dieser Beruf obsolet werden könnte oder zumindest ein nicht unwesentlicher Teil der bisherigen Arbeit wegfallen wird. Man könnte insofern von einer Erosion der juristischen Arbeitsweise sprechen. Die Frage ist allerdings, wie groß die Gefahr wirklich ist. Hier muss der mögliche Einsatz im Justizsystem und im Anwaltsberuf unterschieden werden.

1. Stilometrie

LLMs können sprachlich stark standardisierte und wiederkehrende Muster erzeugen. In der sogenannten Stilometrie10 sind Stilmerkmale statistisch messbar und vergleichbar. Hierzu können verschiedene Metriken herangezogen werden. In der Sprachwissenschaft lassen sich dabei verschiedene Merkmalsgruppen unterscheiden. So kann man einen Text anhand diskursiver Merkmale charakterisiern. Damit sind unter anderem Kohäsionsmarker gemeint.11

2. Beispiel anhand eines Urteils

Das Urteil des BGH vom 25.06.202612 zeigt exemplarisch die Struktur eines Urteils und insbesondere die Bedeutung von Semantik und Kohärenz im juristischen Kontext. Zunächst fällt die Häufung von anaphorischen Rückverweisen auf. Diese Art der referenziellen Kohäsion ist für die juristische Argumentation und Nachvollziehbarkeit von erheblicher Bedeutung. Dabei ist nicht nur der allgemeine Verweis auf Gesetze oder Normen gemeint. Vielmehr werden auf diese Weise bisherige Rechtsauffassungen und Verfahren wiedergegeben und in einen Kontext gesetzt. Eine qualitativ hochwertige juristische Arbeitsweise zeichnet sich dadurch aus, dass sie detailorientiert und einzelfallbezogen ist.

Der Kern dieses Urteils beschäftigt sich im Wesentlichen mit der tatbestandlichen Voraussetzung des unanfechtbaren Vereinsverbots, das von einem vereinsrechtlichen Betätigungsverbot zu unterscheiden ist. Konkret stellt der BGH für § 86 I Nr. 2 StGB darauf ab, dass die betreffende Vereinigung unanfechtbar verboten sein muss. Ein ausschließlich für Deutschland erlassenes Betätigungsverbot genügt hierfür nicht.

In einem rein auf sprachliche oder semantische Ähnlichkeit ausgerichteten Retrieval können die Begriffe „Vereinsverbot“ und „Betätigungsverbot“ aufgrund ihres gemeinsamen thematischen Kontextes eng beieinanderliegen, gegebenenfalls sogar synonymisch.

Ausgehend von einem klassischen RAG, würde ein Urteil beispielsweise unterteilt („Chunking") und sodann durch Embeddings als Vektoren dargestellt, sodass das LLM für eine Anfrage als relevant bewertete Textabschnitte als zusätzlichen Kontext erhält.

Hier besteht allerdings die Gefahr eines schwerwiegendes Problems. Bei einem überwiegend auf semantische Ähnlichkeit gestützten Retrieval können zusammenhängende Begründungen, innerhalb des Urteils auf mehrere, voneinander getrennte Textabschnitte verteilt sein. Wird lediglich ein einzelner Abschnitt abgerufen, kann dadurch der juristisch entscheidende argumentative Kontext verloren gehen. Eine ähnliche Systematik muss bei der Verarbeitung von Gesetzen beachtet werden. Das Retrieval kann daher nicht nur aufgrund eines Embeddings und semantischer Ähnlichkeit agieren. Vielmehr muss eine Rekonstruktion normativer und argumentativer Zusammenhänge erfolgen. Die Aufbereitung muss referenzsensitiv erfolgen.13

Für den Einsatz von KI besteht daher ein großes Potenzial. KI kann bei jenen Aufgaben helfen, die repetitiv sind und etwa die Wiedergabe von Normenketten betreffen. Die Relationstechnik ist eine wesentliche juristische Arbeitsmethode, die dazu dient, komplexe Sachverhalte aufzuarbeiten und systematisch auszuwerten. Auch bei einer solchen Grundstrukturierung könnte KI sinnvoller eingesetzt werden, als von ihr die gesamte fehlerfreie Formulierung eines Urteils zu verlangen. Denkbar wäre etwa die Strukturierung von Behauptungen und die Gegenüberstellung von einem stretigen und unstreigen Vorbringen.

III. Machine Bias

In diesem Zusammenhang ist auch das Problem der algorithmischen Voreingenommenheit anzusprechen, der sogenannte Machine Bias. Erfahrungswerte und Trainingsdaten, die dem LLM zur Verfügung gestellt werden, können zu verstärkter Diskriminierung14 führen. Dieses Problem wird etwa in der Dikussion um das amerikanische COMPAS-System deutlich, das zur Einschätzung von Rückfallrisiken eingesetzt wurde. Die Bewertung von algorithmischer Fairness ist dabei umstritten. Ein Social Profiling und die damit Ungleichbehandlung können begünstigt werden. Das wird vor allem dann relevant, wenn KI in der Zukunft zur Analyse von Beweisen eingesetzt wird und ihre Ergebnisse unmittelbar oder mittelbar gerichtliche Entscheidungen beeinflussen könnten.15

D. Ausblick

Es ist daher wichtig, die Hintergründe und Grenzen eines LLMs zu verstehen. Die genannten Grundsätze fallen dabei unter den Begriff der Informationskompetenz. Damit ist in diesem Zusammenhang insbesondere die Fähigkeit gemeint, Informationen zu recherchieren, in den jeweiligen Kontext einzuordnen und vor allem ihre Verlässlichkeit kritisch zu überprüfen. Dabei sollte nicht jedem KI-generierten Dokument misstraut werden. Vielmehr muss erkannt werden, welcher Abschnitt der Überprüfung bedarf. Das muss kontrolliert und bewusst erfolgen.


  1. Wahl, KI: Semantik stark, Generierung schwach: Warum RAG-Systeme eine informationswissenschaftliche Architektur brauchen, Information – Wissenschaft & Praxis (2026), 90, 93. ↩︎

  2. Aus dem Lateinischen cohaerere bzw. cohaerentia. Köharenz meinte daher „den roten Faden". Fritz, Grundfragen der linguistischen Kommunikationsanalyse, Tübingen 1982, S. 144 ff. ↩︎

  3. Aus dem Lateinischen cohaerere bzw. cohaesio. Fritz, Grundfragen der linguistischen Kommunikationsanalyse, Tübingen 1982, S. 144 ff. ↩︎

  4. Hindi et al., Enhancing the Precision and Interpretability of Retrieval-Augmented Generation (RAG) in Legal Technology: A Survey, 2025. ↩︎

  5. Siehe dazu: Knorr/Heine, Kohärenzbildung in KI-generierten Texten. Implikationen für die Textproduktion von Schreibenden, Journal of Language and Communication in Business (2024), 213, 233. Knorr/Heine nennen einen interessanten sprachwissenschaftlichen Ansatz und die Bedeutung für SuS, die Fähigkeit der Verwendung von Kohäsionsmarkern zu erlernen; siehe dazu auch: Frenzke-Shim in: Kepser/Körner/Schallenberger, DU trifft KI. Implikationen Künstlicher Intelligenz für die Deutschdidaktik, MiDU 2026, 1-21. ↩︎

  6. Bozkurt, Retrieval-Augmented Generation mit LLMs in finanzbezogenen Frage-Antwort-Systemen, 2025. Muhammad Arslan et al., Procedia Computer Science 246 (2024), 3781, 3786. ↩︎

  7. Li, Jia, Xu et al., A Survey of Personalization: From RAG to Agent, ACM Transactions on Information Systems (2026), Article 93, 27. Siehe dazu: https://opil.ouplaw.com/display/10.1093/law:epil/9780199231690/law-9780199231690-e775 (zuletzt abgerufen am 06.10.2026). ↩︎ ↩︎

  8. So waren es 2017 noch ca. 937.000 Neuzugänge und im Jahr 2024 rund 806.000, vgl. dazu: https://genesis.destatis.de/datenbank/online/statistic/24231/table/24231-0002 (zuletzt abgerufen am 01.10.2026); deutlich extremer zeigt sich die Lage bei Strafverfahren, siehe dazu: https://genesis.destatis.de/datenbank/online/statistic/24221/table/24221-0002; https://genesis.destatis.de/datenbank/online/statistic/24211/table/24211-0003 (zuletzt abgerufen am 01.10.2026). ↩︎

  9. Reuß, KI und höchstrichterliche Rechtsprechung, Praxis der Rechtspsychologie (2026), 1, 3; https://www.lto.de/recht/nachrichten/n/schleswig-holstein-sozialgerichte-ki-antraege-klagewelle-eilverfahren (zuletzt abgerufen am 01.10.2026). ↩︎

  10. Die computergestützte Analyse von Textstilen mittels statistischer Verfahren, um Autorenschaften zu bestimmen oder Texte zu vergleichen, siehe dazu: Burbach, Sprachlicher Fingerabdruck im KI-unterstützten Schreiben, in: Trautzsch et al. (Hrsg.), Generative KI: Handbuch für Praxis und Lehre, Springer 2026, S. 5-7. ↩︎ ↩︎

  11. Burbach, in: Trautzsch et al. (Hrsg.), Generative KI: Handbuch für Praxis und Lehre, Sprachlicher Fingerabdruck im KI-unterstützten Schreiben, S. 5. ↩︎

  12. Das Urteil beleuchtet die Auslegung des Tatbestands aus § 86 I Nr. 2 StGB und die betreffende Vereinigung, die unanfechtbar verboten sein muss. Vgl. dazu: BGH, Urteil vom 25. Juni 2026 – 3 StR 311/25. ↩︎

  13. Vgl. Hindi et al., Enhancing the Precision and Interpretability of Retrieval-Augmented Generation (RAG) in Legal Technology: A Survey, 2025. ↩︎

  14. Avedisian, Autonome Gefängniswärter im Schweizer Strafvollzug: Pioniergeist oder digitales Panoptikum?, in: Gless/Avedisian (Hrsg.), Künstliche Intelligenz in der Strafrechtspflege, Nomos 2025, S. 77. ↩︎

  15. Avedisian, Autonome Gefängniswärter im Schweizer Strafvollzug: Pioniergeist oder digitales Panoptikum?, in: Gless/Avedisian (Hrsg.), Künstliche Intelligenz in der Strafrechtspflege, Nomos 2025, S. 78. ↩︎

Annika S. Zierhut
Annika S. Zierhut
Juristin, Mag. iur., Recht, Technologie und KI