Das Wichtigste in Kürze
- Klassische OCR erkennt Zeichen. Ein Bild-Sprach-Modell versteht zusätzlich Tabellen, Zuordnungen und Hinweise.
- Beide Verfahren werden kombiniert, nicht gegeneinander ausgespielt.
- Wichtige Werte werden gegen Stammdaten und Rechenregeln geprüft.
- Die Oberfläche zeigt die Fundstelle im Originalbild.
- Bei einfachen, gleichförmigen Formularen kann klassische Texterkennung allein die bessere Lösung sein.
Zu den Dokumenten, die in einem Betrieb ankommen, gehören nicht nur gepflegte PDFs mit sauberer Textebene. Dazu gehört auch der Lieferschein, den ein Fahrer zwischen zwei Staplerfahrten in der Halle fotografiert hat — leicht schräg, die untere Hälfte im Schatten, quer über der Mengenspalte ein Stempel. Menschen lesen so etwas ohne große Mühe. Eine Fachanwendung kann die Angaben nicht direkt übernehmen.
Klassische OCR hilft — die Abkürzung steht für optische Zeichenerkennung, das Verfahren erkennt Buchstaben und Zahlen in einem Bild. Bei Tabellen, Stempeln, handschriftlichen Ergänzungen und ungewöhnlichen Seiten geht jedoch oft der Zusammenhang verloren.
Ein Bild-Sprach-Modell verarbeitet Bild und Sprache gemeinsam. Es erkennt, welche Zahl zu welcher Spalte gehört, ob ein Hinweis eine Lieferbedingung ist und welche Zeilen eine Position bilden. Es liest auch die handschriftliche Ergänzung „+200, tel. besprochen“ am Rand — was mit so einer Ergänzung geschieht, entscheidet allerdings die Fachregel, nicht das Modell.
Verlässlich wird die Auswertung nicht durch einen einzelnen Modellaufruf. Verlässlich wird die ganze Verarbeitungskette.
Zwei Verfahren mit verschiedenen Stärken
| Aufgabe | Klassische OCR | Bild-Sprach-Modell |
|---|---|---|
| gedruckte Zeichen erkennen | oft schnell und sehr gut | gut, aber rechenintensiver |
| genaue Position eines Wortes liefern | stark | je nach Modell weniger genau |
| Tabellen und Layout verstehen | begrenzt | stark bei wechselnden Darstellungen |
| Hinweise fachlich einordnen | kaum | kann Bedeutung und Zusammenhang erfassen |
| Ergebnis unabhängig prüfen | liefert ein zweites Lesesignal | liefert strukturierte fachliche Angaben |
Wir nutzen beide Ergebnisse als getrennte Signale. Stimmen sie bei einer kritischen Zahl nicht überein, muss der Fall geprüft werden.
Vom Original zur Arbeitskopie
Die eingegangene Datei bleibt unverändert erhalten. Gedrehte, zugeschnittene oder kontrastverbesserte Seiten sind Arbeitskopien — jede spätere Entscheidung lässt sich so am Original prüfen. Die Vorbereitung selbst geschieht vorsichtig: Seiten werden gerade gerückt, entzerrt und auf eine passende Auflösung gebracht, Rauschen und schwacher Kontrast behutsam korrigiert.
Wie behutsam, hat ein früher Test gezeigt. Nach einer zu kräftigen Kontrastkorrektur wurde aus einer blassen Acht eine überzeugende Drei — überzeugend genug, dass sie erst beim Abgleich mit der Bestellmenge auffiel. Seither gilt: lieber ein schwaches Bild und eine Prüfung mehr als ein schönes Bild mit falschem Inhalt.
Zwei Lesungen, ein Abgleich
Auf der Arbeitskopie läuft zuerst die Texterkennung. Sie liefert Zeichen, Positionen und eigene Qualitätswerte — Angaben, die später helfen, einen Wert im Dokument hervorzuheben und Abweichungen zu erkennen.
Danach kommt das Bild-Sprach-Modell, mit einem bewusst engen Auftrag. Der lautet nicht „Lies die Seite“. Das Modell erhält feste Felder — Position, Artikelnummer, Menge, Termin, Lieferhinweis — und darf nur diese Angaben liefern.
Beide Lesungen werden bei wichtigen Werten verglichen. Artikelnummern, Einheiten, Daten und Summen laufen zusätzlich gegen Stammdaten und Rechenregeln. Ein Unterschied wird nicht still erraten: Der Fall geht zur Prüfung, und die Oberfläche markiert den Bildbereich, aus dem der Wert stammt, zeigt beide Lesungen und den Grund. Das erspart die Suche auf einer vollen Seite, auf der ein Stempel die halbe Tabelle verdeckt.
Ein einfaches Ergebnisformat
Feste Angaben statt freier Beschreibung
{
"document_type": "purchase_order",
"order_number": "A-4711",
"items": [
{
"article_number": "GT-18",
"quantity": 2500,
"unit": "piece",
"source_page": 2
}
],
"requested_date": "2026-09-14",
"needs_review": false,
"review_reasons": []
}Die nächste Programmstelle kann diese Form eindeutig lesen. Sie prüft, ob Pflichtangaben fehlen, Zahlen sinnvoll sind und Artikel im zuständigen System vorkommen.
Warum wir Qwen2.5-VL-32B-Instruct eingesetzt haben
In unserem Testsatz lieferte Qwen2.5-VL-32B-Instruct eine gute Verbindung aus Dokumentverständnis, festen Ausgaben und lokaler Ausführbarkeit. Entscheidend war nicht eine öffentliche Rangliste. Entscheidend waren die tatsächlichen Bilder und Dokumente des Betriebs — einschließlich der Fotos aus der Halle.
Die Modellwahl bleibt zeitabhängig. Ein fester eigener Testsatz erlaubt, neue Modelle später unter denselben Bedingungen zu vergleichen.
Typische Fehler der Dokumentauswertung
- Null und Buchstabe O, Eins und kleines l, Komma und Punkt,
- Zeilen, die auf der nächsten Seite weiterlaufen,
- Stempel oder Handschrift über gedrucktem Text,
- Tabellen ohne sichtbare Linien,
- mehrere Einheiten in einem Dokument,
- versteckter Text in einer PDF-Ebene,
- abgeschnittene Ränder und unvollständige Scans.
Diese Fehler werden nicht alle durch ein größeres Modell gelöst. Häufig braucht es bessere Bildvorbereitung, eine zweite Lesung oder eine klare Fachregel. Der tückischste Fall in der Liste ist die versteckte PDF-Ebene: Ein Dokument, das wie ein harmloser Scan aussieht, kann eine unsichtbare Textebene mit ganz anderem Inhalt tragen. Deshalb zählt, was auf dem Bild steht — nicht, was die Datei behauptet.
Dokumente aus fremder Quelle bleiben fremde Daten
Ein PDF kann versteckte Anweisungen enthalten. Sein Inhalt darf deshalb keine Rechte, Werkzeuge oder Empfänger bestimmen. Die Anwendung setzt diese Grenzen außerhalb des Modells. Der Sicherheitsartikel beschreibt den Aufbau.
Datenschutz und Aufbewahrung
Lokale Verarbeitung hält Dokumente im Betrieb. Sie ersetzt trotzdem nicht Zweckbindung, Zugriffsrechte und Löschfristen. Gerenderte Seiten und erkannte Zwischentexte werden nur so lange aufbewahrt, wie Bearbeitung und Nachweis es verlangen.
Wann sich der Aufwand lohnt
Die Kombination lohnt sich, wenn Dokumente stark variieren, Tabellen und Layout eine fachliche Bedeutung tragen oder manuelle Erfassung regelmäßig Zeit bindet.
Bei einem immer gleichen, sauber gedruckten Formular kann klassische OCR mit festen Regeln günstiger und verlässlicher sein. Nicht jede Seite braucht ein großes Modell.
Fazit
Texte aus Bildern nutzbar zu machen ist keine einzelne KI-Funktion. Es ist ein kontrollierter Datenprozess: Original sichern, Bild vorbereiten, Zeichen erkennen, Bedeutung erfassen, Werte prüfen und Fundstellen zeigen.
In unserem Projekt gehört diese Fähigkeit zur lokalen Plattform des Betriebs. Sie unterstützt die Auswertung der Bestellungen und kann zugleich für weitere begrenzte Dokumentaufgaben genutzt werden — der fotografierte Lieferschein ist damit lesbar geworden. Der Stempel stört ihn nicht mehr.
Offizielle technische Quellen
Dokumente brauchen einen prüfbaren Datenweg
Die richtige Verbindung aus Texterkennung, Bildmodell und Fachprüfung hängt von den tatsächlichen Dokumenten ab.
Dokumentprozess besprechen