Zum Inhalt springen

Large Language Model: verständlich erklärt für Firmen

Large Language Model verständlich erklärt: wie Token-Vorhersage funktioniert, was ein Modell vom Produkt trennt und warum Antworten falsch sein können.

Eine Papierfolge im Kanzleibüro zeigt die Vorhersage des nächsten Tokens; im Bild stehen LLM: WAS IST DAS? und drei erklärende Hinweise.
Von AI Priority Map Editorial

Kurzantwort: Ein Large Language Model, kurz LLM, ist ein mit sehr vielen Daten trainiertes KI-Modell, das jeweils das nächste Token vorhersagt. So entstehen flüssige Texte und vielseitige Antworten. Das Modell ist nicht das Produkt, in das Sie sich einloggen, und eine plausible Antwort ist keine Gewähr für sachliche Richtigkeit.

Zusammenfassung als Mindmap

Large Language Model: verständlich erklärt für Firmen
│
├─ Grundmechanik
│   ├─ Modell sagt jeweils das nächste Token voraus
│   ├─ Viele Schritte ergeben eine flüssige Antwort
│   └─ Plausibilität ist keine Tatsachenprüfung
│
├─ Modell und Produkt
│   ├─ Modell — statistischer Kern
│   └─ Produkt — Oberfläche, Werkzeuge und Regeln
│
├─ Rechtlicher Begriff
│   ├─ Allgemeinheit und viele Aufgaben
│   ├─ Integration in nachgelagerte Systeme
│   └─ Systemisches Risiko hat eine eigene Schwelle
│
└─ Auswahl im Betrieb
    ├─ Aufgabe und Fehlkosten zuerst beschreiben
    ├─ Repräsentative Beispiele testen
    └─ Menschliche Kontrolle festlegen

Das Modell in einem verständlichen Satz

Ein Large Language Model berechnet, welche kleine Texteinheit als Nächstes wahrscheinlich folgt. Diese Einheit heißt Token und kann ein Wort, ein Wortteil oder ein Satzzeichen sein. Aus sehr vielen aufeinanderfolgenden Vorhersagen entsteht eine Antwort. Das Verfahren wirkt wie Schreiben, beginnt technisch aber als Wahrscheinlichkeitsrechnung über eine Zeichenfolge.

Der Name beschreibt drei Eigenschaften. „Large“ verweist auf sehr viele Modellparameter und umfangreiche Trainingsdaten. „Language“ bezeichnet den Schwerpunkt auf sprachlichen Mustern. „Model“ bedeutet, dass das System gelernte statistische Zusammenhänge abbildet. Es ist weder eine Enzyklopädie noch eine Datenbank, in der jede Antwort als fertiger Satz liegt.

Ein einfaches Beispiel zeigt die Mechanik. Nach „Bitte senden Sie die Rechnung an“ sind Wörter wie „uns“, „die Buchhaltung“ oder eine Adresse wahrscheinlicher als ein völlig fachfremder Ausdruck. Das Modell bewertet mögliche Fortsetzungen, wählt ein Token und wiederholt den Vorgang. Dabei berücksichtigt es den bisherigen Gesprächskontext, nicht eine menschliche Absicht.

Was die Vorhersage für Antworten bedeutet

Token-Vorhersage erklärt sowohl die Stärke als auch die Schwäche eines LLM. Das Modell kann Muster aus vielen Textsorten verbinden und deshalb Entwürfe, Zusammenfassungen, Klassifikationen oder Antworten erzeugen. Es prüft jedoch nicht automatisch, ob die erzeugte Aussage in der realen Welt wahr ist.

NIST beschreibt generative Modelle als Systeme, deren Ausgaben die statistische Verteilung ihrer Trainingsdaten annähern. Bei LLMs geschieht dies durch die Vorhersage des nächsten Tokens oder Wortes. Derselbe Mechanismus kann faktisch falsche oder in sich widersprüchliche Aussagen erzeugen; NIST nennt dieses Risiko Konfabulation.2

Eine selbstsichere Formulierung ist deshalb kein Qualitätsnachweis. Grammatik, Ton und innere Plausibilität können hervorragend sein, obwohl ein Name, ein Datum oder eine Rechtsfolge falsch ist. Je höher der Schaden einer falschen Ausgabe, desto stärker muss die Prüfung sein. Ein Entwurf für eine interne Einladung verlangt weniger Kontrolle als eine Auskunft an einen Kunden.

AufgabeWas das LLM leisten kannWas zusätzlich nötig bleibt
TextentwurfFormulieren und strukturierenFakten und Freigabe prüfen
ZusammenfassungKernaussagen verdichtenVollständigkeit am Original prüfen
KlassifikationBeispiele nach Mustern ordnenGrenzfälle und Fehlkosten kontrollieren
RechercheantwortHinweise zusammenführenQuellen öffnen und Aussagen belegen

Modell und Produkt sind verschiedene Ebenen

Das Modell ist der statistische Kern. Das Produkt ist die konkrete Anwendung, die ein Unternehmen benutzt. Dazu gehören Oberfläche, Zugriffsrechte, Systemanweisungen, Dateiupload, Suchfunktionen, Protokollierung und gegebenenfalls andere Werkzeuge. Wer nur den Modellnamen vergleicht, übersieht einen großen Teil der tatsächlichen Arbeitsumgebung.

Ein Produkt kann eine Anfrage vor der Übergabe verändern, zusätzliche Dokumente abrufen oder die Ausgabe nachbearbeiten. Ein anderes Produkt kann dasselbe Basismodell ohne diese Schritte einsetzen. Deshalb können zwei Anwendungen mit demselben Modell unterschiedliche Ergebnisse liefern. Auch die vertragliche Behandlung eingegebener Daten hängt vom Anbieter und Tarif ab, nicht allein vom Modell.

Für die Auswahl sollte das Unternehmen daher zwei Fragen trennen. Erstens: Reicht die Fähigkeit des Modells für die Aufgabe? Zweitens: Bietet das Produkt die erforderlichen Kontrollen für Daten, Nutzer und Freigaben? Die Artikel über KI-Agenten für kleine Unternehmen(Artikel auf Englisch) und KI-Agenten im Vergleich zu Automationsplattformen(Artikel auf Englisch) zeigen, wie zusätzliche Werkzeuge die Rolle eines Modells verändern.

Die Begriffe der KI-Verordnung

Die KI-Verordnung verwendet den weiteren Rechtsbegriff „KI-Modell mit allgemeinem Verwendungszweck“. Artikel 3 Nummer 63 erfasst ein Modell, das erhebliche Allgemeinheit zeigt, viele unterschiedliche Aufgaben kompetent erledigen kann und sich in verschiedene nachgelagerte Systeme oder Anwendungen integrieren lässt.1 Der Begriff hängt damit nicht an einer einzelnen Chat-Oberfläche.

Erwägungsgrund 98 nennt Modelle mit mindestens einer Milliarde Parametern, die mit großen Datenmengen in groß angelegter Selbstüberwachung trainiert wurden, als Modelle mit erheblicher Allgemeinheit.1 Erwägungsgrund 99 nennt große generative Modelle als typisches Beispiel, weil sie flexibel Texte, Audio, Bilder oder Videos für viele Aufgaben erzeugen können.1

Eine Milliarde Parameter ist ein Einordnungssignal, aber nicht die Schwelle für systemisches Risiko. Artikel 51 Absatz 2 vermutet Fähigkeiten mit hohem Wirkungsgrad, wenn die kumulierte Trainingsrechenleistung mehr als 10^25 Gleitkommaoperationen beträgt.1 Diese Rechtskategorie betrifft also eine deutlich speziellere Risikostufe als die alltägliche Frage, ob ein Werkzeug ein LLM nutzt.

Die konsolidierte Fassung behält die drei Kernelemente bei: erhebliche Allgemeinheit, viele unterschiedliche Aufgaben und Integration in zahlreiche Anwendungen.3 Die Leitlinien der Kommission ergänzen technische Kriterien und stellen klar, dass bei Änderungen nur erhebliche Modifikationen, nicht geringfügige Anpassungen, Anbieterpflichten für den Ändernden auslösen.4

Was kleine Firmen daraus ableiten sollten

Die praktische Entscheidung beginnt nicht mit der Parameterzahl. Sie beginnt mit der Aufgabe. Ein Unternehmen sollte beschreiben, welche Eingaben verarbeitet werden, welche Ausgabe erwartet wird und wer einen Fehler bemerkt. Danach wird sichtbar, ob ein allgemeines Sprachmodell nötig ist oder ein engeres Werkzeug genügt.

Für wiederholbare Prozesse lohnt sich ein kleiner Test mit echten, zulässigen Beispielen. Die Bewertung sollte Richtigkeit, Auslassungen, unerwünschte Variation und den Aufwand der menschlichen Prüfung erfassen. Eine Demo mit einer gelungenen Antwort sagt wenig über seltene Grenzfälle. Besonders wichtig sind Beispiele, bei denen eine falsche Antwort teuer oder unfair wäre.

Ein LLM sollte nicht mit Autonomie verwechselt werden. Ein Modell erzeugt eine Ausgabe; ein Agent kann zusätzlich Werkzeuge aufrufen und Schritte ausführen. Die Bewertung von Agentenchancen(Artikel auf Englisch) hilft bei der Frage, ob diese zusätzliche Handlungsebene überhaupt gebraucht wird. Für strukturierte Rechnungsprozesse zeigt KI in der Kreditorenbuchhaltung(Artikel auf Englisch), wie eng eine Aufgabe abgegrenzt werden kann.

Wann diese Erklärung nicht entscheidet

Die Definition sagt nicht, welches Produkt für einen konkreten Betrieb sicher oder wirtschaftlich ist. Sie ersetzt weder eine technische Prüfung noch eine rechtliche Bewertung der verarbeiteten Daten. Auch die Bezeichnung „general-purpose“ beantwortet nicht automatisch, welche Pflichten bei einem bestimmten Einsatz gelten.

Anbieter können Modellnamen, Versionen und Produktfunktionen ändern. Ein Auswahlvermerk sollte deshalb die getestete Version, den Zweck, die Datenarten und die Freigaberegel festhalten. Wird das Produkt später erweitert oder mit Werkzeugen verbunden, muss die Bewertung den neuen Ablauf betrachten.

Nächste Schritte

Formulieren Sie den geplanten Einsatz in einem Satz und sammeln Sie zehn repräsentative Beispiele. Prüfen Sie anschließend nicht nur die flüssigste Antwort, sondern Fehler, Auslassungen und den nötigen Kontrollaufwand. Halten Sie Modell, Produkt, Version und Freigabepunkt getrennt fest.

Häufig gestellte Fragen

Was ist ein Large Language Model in einem Satz?

Ein Large Language Model ist ein mit sehr vielen Textdaten trainiertes KI-Modell, das aus dem bisherigen Kontext Wahrscheinlichkeiten für das nächste Token berechnet. Dadurch kann es Texte erzeugen und viele sprachliche Aufgaben bearbeiten, ohne die Aussagen so zu verstehen oder zu prüfen, wie ein Mensch es tun würde.

Ist ein LLM dasselbe wie ein Chatbot?

Nein. Das LLM ist das zugrunde liegende Modell. Ein Chatbot ist ein Produkt, das dieses Modell mit Oberfläche, Systemanweisungen, Suchzugriff, Filtern, Dateien und weiteren Werkzeugen verbindet. Zwei Produkte können dasselbe Modell verwenden und trotzdem deutlich unterschiedliche Antworten, Datenschutzoptionen und betriebliche Arbeitsabläufe für verschiedene Nutzer bieten.

Warum kann ein LLM überzeugend falsche Antworten geben?

Das Modell erzeugt eine statistisch plausible Fortsetzung, keinen geprüften Tatsachenbericht. Wenn der Kontext lückenhaft ist, kann eine sprachlich stimmige, aber sachlich falsche Aussage entstehen. NIST bezeichnet solche falschen oder widersprüchlichen Ausgaben als Konfabulationen. Gute Formulierungen sind daher allein kein ausreichender Beleg für vollständige sachliche Richtigkeit.

Wann ist ein Modell nach der KI-Verordnung general-purpose?

Entscheidend sind erhebliche Allgemeinheit, die kompetente Bearbeitung vieler unterschiedlicher Aufgaben und die Einbindung in zahlreiche nachgelagerte Systeme oder Anwendungen. Die Verordnung nennt groß angelegtes selbstüberwachtes Training als typisches Merkmal. Eine bloße Produktbezeichnung oder ein einzelner konkreter Anwendungsfall entscheidet die vollständige rechtliche Einordnung wirklich niemals allein.

Worauf sollte ein kleines Unternehmen bei der Auswahl achten?

Das Unternehmen sollte zuerst den konkreten Arbeitszweck, die benötigten Daten, die Folgen einer falschen Ausgabe und die erforderliche menschliche Kontrolle festlegen. Danach lassen sich Produktfunktionen, Vertragsbedingungen und Modellgrenzen vergleichen. Ein größeres Modell ist nicht automatisch die bessere Wahl für eine eng begrenzte betriebliche Aufgabe mit klaren Regeln.

Häufig gestellte Fragen

Was ist ein Large Language Model in einem Satz?
Ein Large Language Model ist ein mit sehr vielen Textdaten trainiertes KI-Modell, das aus dem bisherigen Kontext Wahrscheinlichkeiten für das nächste Token berechnet. Dadurch kann es Texte erzeugen und viele sprachliche Aufgaben bearbeiten, ohne die Aussagen so zu verstehen oder zu prüfen, wie ein Mensch es tun würde.
Ist ein LLM dasselbe wie ein Chatbot?
Nein. Das LLM ist das zugrunde liegende Modell. Ein Chatbot ist ein Produkt, das dieses Modell mit Oberfläche, Systemanweisungen, Suchzugriff, Filtern, Dateien und weiteren Werkzeugen verbindet. Zwei Produkte können dasselbe Modell verwenden und trotzdem deutlich unterschiedliche Antworten, Datenschutzoptionen und betriebliche Arbeitsabläufe für verschiedene Nutzer bieten.
Warum kann ein LLM überzeugend falsche Antworten geben?
Das Modell erzeugt eine statistisch plausible Fortsetzung, keinen geprüften Tatsachenbericht. Wenn der Kontext lückenhaft ist, kann eine sprachlich stimmige, aber sachlich falsche Aussage entstehen. NIST bezeichnet solche falschen oder widersprüchlichen Ausgaben als Konfabulationen. Gute Formulierungen sind daher allein kein ausreichender Beleg für vollständige sachliche Richtigkeit.
Wann ist ein Modell nach der KI-Verordnung general-purpose?
Entscheidend sind erhebliche Allgemeinheit, die kompetente Bearbeitung vieler unterschiedlicher Aufgaben und die Einbindung in zahlreiche nachgelagerte Systeme oder Anwendungen. Die Verordnung nennt groß angelegtes selbstüberwachtes Training als typisches Merkmal. Eine bloße Produktbezeichnung oder ein einzelner konkreter Anwendungsfall entscheidet die vollständige rechtliche Einordnung wirklich niemals allein.
Worauf sollte ein kleines Unternehmen bei der Auswahl achten?
Das Unternehmen sollte zuerst den konkreten Arbeitszweck, die benötigten Daten, die Folgen einer falschen Ausgabe und die erforderliche menschliche Kontrolle festlegen. Danach lassen sich Produktfunktionen, Vertragsbedingungen und Modellgrenzen vergleichen. Ein größeres Modell ist nicht automatisch die bessere Wahl für eine eng begrenzte betriebliche Aufgabe mit klaren Regeln.

Quellen

  1. 1.Regulation (EU) 2024/1689 (Artificial Intelligence Act)EUR-Lex · 2024
  2. 2.Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence ProfileNIST · 2024
  3. 3.Regulation (EU) 2024/1689 — consolidated textEUR-Lex · 2026
  4. 4.Guidelines for general-purpose AI model providersEuropean Commission · 2026

Wie sähe diese Analyse für Ihr Unternehmen aus?

Das AI Foundation Audit bewertet Ihren KI-Einsatz strukturiert – von Integrationsrisiken über Governance-Lücken bis zu ROI-Potenzialen. Das Ergebnis erhalten Sie als umfassenden Bericht, mit dem Sie unmittelbar handeln können.

Audit starten

Sie erhalten den Strategiebericht und den Umsetzungsleitfaden – zugeschnitten auf Ihr Unternehmen und sofort verfügbar.