Intelligente Dokumentenverarbeitung erklärt: OCR oder LLM, Validierung und menschliche Prüfung
Intelligente Dokumentenverarbeitung erklärt: OCR oder LLM, Validierung, menschliche Prüfung, E-Rechnung, mit Beispielen zu Rechnung und Bestellung.

Auf dieser Seite
Intelligente Dokumentenverarbeitung (Intelligent Document Processing, IDP) ist Software, die Geschäftsdokumente wie Rechnungen, Bestellungen und Anfragen liest, die benötigten Daten herauszieht, prüft und in Ihre Systeme schreibt. Menschen fassen nur noch die Fälle an, die falsch aussehen. Dafür arbeiten zusammen: OCR oder ein bildfähiges Modell, das die Seite liest, ein Extraktionsschritt, der die richtigen Felder findet, Prüfregeln, die Fehler abfangen, und eine Prüfwarteschlange für alles, was durchfällt.
Der Begriff ist nicht neu, das Interesse schon. Der Grund ist einfach: Große Sprachmodelle haben die Extraktion aus chaotischen, uneinheitlichen Dokumenten weit praxistauglicher gemacht, als es vorlagenbasierte Tools je waren.
So funktioniert IDP, Schritt für Schritt
| Schritt | Was passiert | Typische Werkzeuge |
|---|---|---|
| 1. Erfassen | Dokumente kommen per E-Mail, Upload, Scanner, EDI oder Portal | Gemeinsames Postfach, überwachter Ordner, API |
| 2. Klassifizieren | Entscheiden, was das Dokument ist: Rechnung, Bestellung, Anfrage, Lieferschein, Sonstiges | Regeln, ein Klassifikator oder ein LLM |
| 3. Lesen | Aus Pixeln werden Text und Layout | OCR oder ein bildfähiges Modell |
| 4. Extrahieren | Felder finden: Lieferant, Daten, Positionen, Summen, Artikelnummern | Vorlagen, ML-Extraktion oder ein LLM mit Schema |
| 5. Validieren | Werte gegen Regeln und Stammdaten prüfen | Code, Abfragen im ERP |
| 6. Prüfen | Fehlschläge und unsichere Ergebnisse an einen Menschen geben | Prüfwarteschlange, einfache Oberfläche |
| 7. Exportieren | Saubere Daten in ERP, Buchhaltung, CRM oder Tabelle schreiben | Schnittstellen, Automatisierungstools |
Der größte Nutzen und das größte Risiko liegen in den Schritten 5 und 6. In Demos glänzt die Extraktion. Die Validierung ist das, was falsche Zahlen aus Ihrer Buchhaltung fernhält.
Und die E-Rechnung?
Seit dem 1. Januar 2025 müssen Unternehmen in Deutschland im inländischen B2B-Verkehr E-Rechnungen empfangen können. Für das Ausstellen gelten Übergangsfristen bis Ende 2026 (Vorjahresumsatz über 800.000 Euro) beziehungsweise Ende 2027 (alle übrigen), laut FAQ des Bundesfinanzministeriums. Eine echte E-Rechnung im Format XRechnung oder ZUGFeRD enthält ihre Daten bereits strukturiert, dort entfallen die Schritte Lesen und Extrahieren weitgehend.
Arbeitslos wird IDP dadurch nicht. In der Übergangszeit kommen weiter PDF-Rechnungen, dazu Rechnungen ausländischer Lieferanten, Kleinbetragsrechnungen, Bestellungen, Lieferscheine, Zeugnisse und Anfragen, alles ohne festen Standard. Und die Validierung gegen Bestellung, Wareneingang und Stammdaten brauchen Sie bei jeder Rechnung, egal in welchem Format. Stand: Oktober 2026, dies ist keine Steuerberatung.
OCR oder LLM-Extraktion
Beides wird oft als Konkurrenz dargestellt. In der Praxis erledigen sie unterschiedliche Aufgaben.
OCR (optische Zeichenerkennung) macht aus einem Bild Text. Moderne OCR ist bei sauberen Scans und digitalen PDFs sehr gut, schwächer bei Handschrift, Stempeln, unscharfen Handyfotos und komplexen Tabellen. OCR allein weiß nicht, dass „30 Tage netto“ eine Zahlungsbedingung ist oder dass die dritte Zahl in einer Zeile der Einzelpreis ist.
Vorlagenbasierte Extraktion setzt auf OCR auf: Sie sagen dem System „bei diesem Lieferanten steht die Rechnungsnummer in diesem Feld“. Genau und vorhersehbar, aber jedes neue Layout braucht eine neue Vorlage. Daran sind ältere IDP-Projekte gescheitert, sobald der lange Schwanz der Lieferanten kam.
LLM-Extraktion gibt einem Sprachmodell, oft einem bildfähigen, das Dokument und ein Schema: „Gib Lieferantenname, USt-IdNr., Rechnungsdatum, Währung, Positionen, Netto, Steuer, Brutto als JSON zurück.“ Es kommt ohne Vorlagen mit neuen Layouts zurecht und versteht Kontext, etwa dass „Lieferadresse“, „Ship-to“ und „Warenempfänger“ dasselbe meinen.
| OCR + Vorlagen | LLM-Extraktion | |
|---|---|---|
| Neue Layouts | Neue Vorlage nötig | Funktioniert meist sofort |
| Vorhersehbarkeit | Hoch: gleiche Eingabe, gleiches Ergebnis | Geringer: kann schwanken und Werte erfinden |
| Chaotische, uneinheitliche Dokumente | Schwach | Stark |
| Tabellen und Positionen | Gut mit abgestimmten Vorlagen | Gut, braucht aber Prüfung von Zeilenzahl und Summen |
| Kosten pro Seite | Niedrig | Höher, je nach Modell und Seitengröße |
| Nachvollziehbarkeit | Klar: dieses Feld, dieser Wert | Braucht Zusatzarbeit (Quelltext oder Position mit ausgeben) |
Die praktische Antwort für die meisten Unternehmen: OCR oder die Textebene des PDFs nutzen, wo sie zuverlässig ist, ein LLM diesen Text in ein striktes Schema übertragen lassen und die Validierung nie auslassen.
Validierung: Hier entsteht die Genauigkeit
Ein LLM, das meistens richtig liegt, produziert bei großem Volumen trotzdem Fehler, und die gefährlichen sehen plausibel aus. Die Validierung macht aus „wahrscheinlich richtig“ ein „geprüft“.
Nützliche Prüfungen, grob nach Wert sortiert:
- Rechnerisch. Positionen ergeben die Nettosumme, Netto plus Steuer ergibt Brutto, Menge mal Einzelpreis ergibt den Positionsbetrag.
- Stammdatenabgleich. Die USt-IdNr. des Lieferanten steht in Ihrer Kreditorenliste, die Artikelnummern im Artikelstamm, der Kunde einer Bestellung ist ein echtes Konto.
- Dokumentübergreifender Abgleich. Rechnung passt zu Bestellung und Wareneingang, der klassische Drei-Wege-Abgleich.
- Formatregeln. Daten sind gültig und plausibel, IBANs bestehen die Prüfziffer, USt-IdNr. entsprechen dem Länderformat.
- Dublettenerkennung. Gleicher Lieferant, gleiche Rechnungsnummer, gleicher Betrag wurde schon verarbeitet.
- Geschäftsregeln. Beträge über einer Schwelle, neue Bankverbindungen oder ungewöhnliche Zahlungsbedingungen gehen immer an einen Menschen.
Jede bestandene Prüfung ist eine Sache weniger, die ein Mensch ansehen muss. Jede nicht bestandene schickt das Dokument mit klarem Grund in die Prüfung.
Für die Buchhaltung gilt außerdem: Originalbelege müssen nach den GoBD unveränderbar und nachvollziehbar archiviert bleiben. IDP liefert Buchungsdaten, ersetzt aber nicht Ihr revisionssicheres Archiv.
Menschliche Prüfung: die Warteschlange gestalten
Der Mensch in der Schleife ist keine Schwäche von IDP, sondern das Konzept.
- Prüfung nach Ausnahme. Menschen sollten nur Dokumente sehen, die eine Prüfung nicht bestanden haben oder unter einer Konfidenzschwelle liegen, nicht alles.
- Belege zeigen. Die prüfende Person braucht den extrahierten Wert neben der markierten Stelle im Original. Ohne das ist die Prüfung langsamer als Abtippen.
- Korrekturen festhalten. Jede Korrektur ist Rückmeldung: Ein wiederkehrender Fehler bei einem Lieferanten braucht vielleicht eine Regel, einen angepassten Prompt oder eine Vorlage.
- Zahlungen nie allein auf Basis der Extraktion freigeben. Geänderte Bankverbindungen sind ein klassisches Einfallstor für Betrug. Dort bleiben ein Mensch und ein Rückruf beim bekannten Ansprechpartner Pflicht.
Welcher Anteil der Dokumente ohne Eingriff durchläuft, hängt von Ihrem Dokumentenmix und der Strenge Ihrer Prüfungen ab. Messen Sie das in einem Pilot an Ihren eigenen Dokumenten und verlassen Sie sich nicht auf die Werbezahl eines Anbieters.
Drei Beispiele
Lieferantenrechnungen
Der häufigste Einstieg. Rechnungen landen als PDF oder E-Rechnung im gemeinsamen Postfach. IDP liest Kopf und Positionen, gleicht mit Bestellung und Wareneingang ab, prüft Umsatzsteuer und Summen und übergibt saubere Rechnungen als Buchungsvorschlag an die Buchhaltung, etwa an DATEV oder das ERP. Abweichungen gehen mit Begründung an die Kreditorenbuchhaltung. Für Kanzleien gibt es mandantenbezogene Varianten, siehe KI für Steuer- und Buchhaltungskanzleien.
Kundenbestellungen
Kunden schicken Bestellungen im eigenen Format: PDF, Excel, Text in der E-Mail. IDP liest Kunde, Lieferadresse, Wunschtermine und Positionen, ordnet Kundenartikelnummern Ihren eigenen zu, prüft Preise gegen die vereinbarte Preisliste und legt einen Auftragsentwurf im ERP an. Bestellungen mit Preisabweichungen oder unbekannten Artikeln gehen an den Innendienst. Allein das kann in einem vollen Auftragseingang täglich Stunden Abtipparbeit sparen.
Anfragen in der Fertigung
Anfragen sind chaotischer: eine E-Mail, ein PDF mit Anforderungen, manchmal Zeichnungen. IDP kann die kaufmännischen Daten (Kunde, Mengen, Werkstoff, Termin, Lieferbedingungen) extrahieren und die technischen Anforderungen für die Kalkulation zusammenfassen. Den Preis sollte es nicht allein festlegen. Illustratives Beispiel: Ein Lohnfertiger schickt jede Anfrage-Mail durch einen Extraktionsschritt, der einen strukturierten Eingangsdatensatz füllt und fehlende Angaben markiert (keine Menge, keine Werkstoffgüte), damit der Kalkulator beim Kunden nachfragen kann, bevor er anfängt. Weitere Anwendungsfälle dieser Art in KI in der Produktion.
Lohnt sich IDP für Sie?
Es lohnt sich, wenn Sie dieselben Dokumentarten in großer Menge verarbeiten, das Abtippen ein sichtbarer Kostenfaktor oder Engpass ist und die Daten ein klares Zielsystem haben.
Es lohnt sich nicht, wenn die Mengen winzig sind, jedes Dokument einzigartig ist und ohnehin von Fachleuten gelesen werden muss oder es kein System gibt, in das die Daten fließen könnten. Dann zuerst den Prozess in Ordnung bringen. Wie Sie das erste Projekt auswählen, steht in KI im Unternehmen einführen.
Ihren Dokumentenfluss automatisieren lassen
Wir bauen Dokumentenverarbeitung für Rechnungen, Bestellungen und Anfragen: Extraktion, Validierung gegen Ihre ERP- oder Buchhaltungsdaten, eine Prüfwarteschlange für Ausnahmen und die Anbindung an Ihre Systeme. Vereinbaren Sie ein Erstgespräch zur Dokumentenverarbeitung und bringen Sie einen Stapel echter Dokumente mit.
FAQ
Fragen von Händlern
Was ist intelligente Dokumentenverarbeitung?
Intelligente Dokumentenverarbeitung (Intelligent Document Processing, IDP) ist Software, die Dokumente wie Rechnungen, Bestellungen oder Anfragen liest, die benötigten Daten in strukturierte Felder überträgt, sie prüft und an Ihre Systeme übergibt. Ein Mensch sieht nur die unsicheren Fälle.
Was ist der Unterschied zwischen OCR und IDP?
OCR macht aus einem Bild Text. IDP geht weiter: Es erkennt, welcher Text die Rechnungsnummer, der Gesamtbetrag oder der Liefertermin ist, prüft diese Werte gegen Regeln und Ihre Stammdaten und leitet das Ergebnis ins ERP, in die Buchhaltung oder ins CRM.
Sind LLMs genau genug für die Datenextraktion aus Dokumenten?
Für viele Geschäftsdokumente sind sie sehr gut, gerade bei wechselnden Layouts. Sie können aber überzeugend klingende Fehler machen. Produktive Systeme kombinieren die Extraktion deshalb mit Prüfregeln, Konfidenzschwellen und menschlicher Prüfung für alles, was eine Prüfung nicht besteht.
Braucht man IDP noch, wenn E-Rechnungen Pflicht sind?
Für echte E-Rechnungen im Format XRechnung oder ZUGFeRD weniger, denn deren Daten sind bereits strukturiert. Aber PDF-Rechnungen aus der Übergangszeit, Rechnungen aus dem Ausland, Bestellungen, Lieferscheine und Anfragen kommen weiter unstrukturiert an. Die Prüfung gegen Bestellungen und Stammdaten bleibt in jedem Fall nötig.
Welche Dokumente sollte ich zuerst automatisieren?
Dokumente mit hohem Volumen, klarem Zielsystem und klaren Prüfungen: Lieferantenrechnungen, Kundenbestellungen und Auftragsbestätigungen sind typische erste Kandidaten. Seltene, chaotische Dokumente ohne strukturiertes Ziel sind schlechte Startpunkte.


