Das Wichtigste in Kürze

  • Klassische OCR erkennt Zeichen. Ein Bild-Sprach-Modell versteht zusätzlich Tabellen, Zuordnungen und Hinweise.
  • Beide Verfahren werden kombiniert, nicht gegeneinander ausgespielt.
  • Wichtige Werte werden gegen Stammdaten und Rechenregeln geprüft.
  • Die Oberfläche zeigt die Fundstelle im Originalbild.
  • Bei einfachen, gleichförmigen Formularen kann klassische Texterkennung allein die bessere Lösung sein.

Zu den Dokumenten, die in einem Betrieb ankommen, gehören nicht nur gepflegte PDFs mit sauberer Textebene. Dazu gehört auch der Lieferschein, den ein Fahrer zwischen zwei Staplerfahrten in der Halle fotografiert hat — leicht schräg, die untere Hälfte im Schatten, quer über der Mengenspalte ein Stempel. Menschen lesen so etwas ohne große Mühe. Eine Fachanwendung kann die Angaben nicht direkt übernehmen.

Klassische OCR hilft — die Abkürzung steht für optische Zeichenerkennung, das Verfahren erkennt Buchstaben und Zahlen in einem Bild. Bei Tabellen, Stempeln, handschriftlichen Ergänzungen und ungewöhnlichen Seiten geht jedoch oft der Zusammenhang verloren.

Ein Bild-Sprach-Modell verarbeitet Bild und Sprache gemeinsam. Es erkennt, welche Zahl zu welcher Spalte gehört, ob ein Hinweis eine Lieferbedingung ist und welche Zeilen eine Position bilden. Es liest auch die handschriftliche Ergänzung „+200, tel. besprochen“ am Rand — was mit so einer Ergänzung geschieht, entscheidet allerdings die Fachregel, nicht das Modell.

Verlässlich wird die Auswertung nicht durch einen einzelnen Modellaufruf. Verlässlich wird die ganze Verarbeitungskette.

Zwei Verfahren mit verschiedenen Stärken

Klassische Texterkennung und Bild-Sprach-Modell
AufgabeKlassische OCRBild-Sprach-Modell
gedruckte Zeichen erkennenoft schnell und sehr gutgut, aber rechenintensiver
genaue Position eines Wortes liefernstarkje nach Modell weniger genau
Tabellen und Layout verstehenbegrenztstark bei wechselnden Darstellungen
Hinweise fachlich einordnenkaumkann Bedeutung und Zusammenhang erfassen
Ergebnis unabhängig prüfenliefert ein zweites Lesesignalliefert strukturierte fachliche Angaben

Wir nutzen beide Ergebnisse als getrennte Signale. Stimmen sie bei einer kritischen Zahl nicht überein, muss der Fall geprüft werden.

Vom Original zur Arbeitskopie

Die eingegangene Datei bleibt unverändert erhalten. Gedrehte, zugeschnittene oder kontrastverbesserte Seiten sind Arbeitskopien — jede spätere Entscheidung lässt sich so am Original prüfen. Die Vorbereitung selbst geschieht vorsichtig: Seiten werden gerade gerückt, entzerrt und auf eine passende Auflösung gebracht, Rauschen und schwacher Kontrast behutsam korrigiert.

Wie behutsam, hat ein früher Test gezeigt. Nach einer zu kräftigen Kontrastkorrektur wurde aus einer blassen Acht eine überzeugende Drei — überzeugend genug, dass sie erst beim Abgleich mit der Bestellmenge auffiel. Seither gilt: lieber ein schwaches Bild und eine Prüfung mehr als ein schönes Bild mit falschem Inhalt.

Zwei Lesungen, ein Abgleich

Auf der Arbeitskopie läuft zuerst die Texterkennung. Sie liefert Zeichen, Positionen und eigene Qualitätswerte — Angaben, die später helfen, einen Wert im Dokument hervorzuheben und Abweichungen zu erkennen.

Danach kommt das Bild-Sprach-Modell, mit einem bewusst engen Auftrag. Der lautet nicht „Lies die Seite“. Das Modell erhält feste Felder — Position, Artikelnummer, Menge, Termin, Lieferhinweis — und darf nur diese Angaben liefern.

Beide Lesungen werden bei wichtigen Werten verglichen. Artikelnummern, Einheiten, Daten und Summen laufen zusätzlich gegen Stammdaten und Rechenregeln. Ein Unterschied wird nicht still erraten: Der Fall geht zur Prüfung, und die Oberfläche markiert den Bildbereich, aus dem der Wert stammt, zeigt beide Lesungen und den Grund. Das erspart die Suche auf einer vollen Seite, auf der ein Stempel die halbe Tabelle verdeckt.

Ein einfaches Ergebnisformat

Feste Angaben statt freier Beschreibung

{
  "document_type": "purchase_order",
  "order_number": "A-4711",
  "items": [
    {
      "article_number": "GT-18",
      "quantity": 2500,
      "unit": "piece",
      "source_page": 2
    }
  ],
  "requested_date": "2026-09-14",
  "needs_review": false,
  "review_reasons": []
}

Die nächste Programmstelle kann diese Form eindeutig lesen. Sie prüft, ob Pflichtangaben fehlen, Zahlen sinnvoll sind und Artikel im zuständigen System vorkommen.

Warum wir Qwen2.5-VL-32B-Instruct eingesetzt haben

In unserem Testsatz lieferte Qwen2.5-VL-32B-Instruct eine gute Verbindung aus Dokumentverständnis, festen Ausgaben und lokaler Ausführbarkeit. Entscheidend war nicht eine öffentliche Rangliste. Entscheidend waren die tatsächlichen Bilder und Dokumente des Betriebs — einschließlich der Fotos aus der Halle.

Die Modellwahl bleibt zeitabhängig. Ein fester eigener Testsatz erlaubt, neue Modelle später unter denselben Bedingungen zu vergleichen.

Typische Fehler der Dokumentauswertung

  • Null und Buchstabe O, Eins und kleines l, Komma und Punkt,
  • Zeilen, die auf der nächsten Seite weiterlaufen,
  • Stempel oder Handschrift über gedrucktem Text,
  • Tabellen ohne sichtbare Linien,
  • mehrere Einheiten in einem Dokument,
  • versteckter Text in einer PDF-Ebene,
  • abgeschnittene Ränder und unvollständige Scans.

Diese Fehler werden nicht alle durch ein größeres Modell gelöst. Häufig braucht es bessere Bildvorbereitung, eine zweite Lesung oder eine klare Fachregel. Der tückischste Fall in der Liste ist die versteckte PDF-Ebene: Ein Dokument, das wie ein harmloser Scan aussieht, kann eine unsichtbare Textebene mit ganz anderem Inhalt tragen. Deshalb zählt, was auf dem Bild steht — nicht, was die Datei behauptet.

Dokumente aus fremder Quelle bleiben fremde Daten

Ein PDF kann versteckte Anweisungen enthalten. Sein Inhalt darf deshalb keine Rechte, Werkzeuge oder Empfänger bestimmen. Die Anwendung setzt diese Grenzen außerhalb des Modells. Der Sicherheitsartikel beschreibt den Aufbau.

Datenschutz und Aufbewahrung

Lokale Verarbeitung hält Dokumente im Betrieb. Sie ersetzt trotzdem nicht Zweckbindung, Zugriffsrechte und Löschfristen. Gerenderte Seiten und erkannte Zwischentexte werden nur so lange aufbewahrt, wie Bearbeitung und Nachweis es verlangen.

Wann sich der Aufwand lohnt

Die Kombination lohnt sich, wenn Dokumente stark variieren, Tabellen und Layout eine fachliche Bedeutung tragen oder manuelle Erfassung regelmäßig Zeit bindet.

Bei einem immer gleichen, sauber gedruckten Formular kann klassische OCR mit festen Regeln günstiger und verlässlicher sein. Nicht jede Seite braucht ein großes Modell.

Fazit

Texte aus Bildern nutzbar zu machen ist keine einzelne KI-Funktion. Es ist ein kontrollierter Datenprozess: Original sichern, Bild vorbereiten, Zeichen erkennen, Bedeutung erfassen, Werte prüfen und Fundstellen zeigen.

In unserem Projekt gehört diese Fähigkeit zur lokalen Plattform des Betriebs. Sie unterstützt die Auswertung der Bestellungen und kann zugleich für weitere begrenzte Dokumentaufgaben genutzt werden — der fotografierte Lieferschein ist damit lesbar geworden. Der Stempel stört ihn nicht mehr.

Offizielle technische Quellen

  1. Qwen-Team: Qwen2.5-VL-32B
  2. Offizielle Modellkarte Qwen2.5-VL-32B-Instruct
  3. OWASP: Schutz vor Prompt Injection

Dokumente brauchen einen prüfbaren Datenweg

Die richtige Verbindung aus Texterkennung, Bildmodell und Fachprüfung hängt von den tatsächlichen Dokumenten ab.

Dokumentprozess besprechen