OCR für Belege, Rechnungen und Formulare: Leitfaden zum SDK zur Datenextraktion
Das OCR-Modul des Apryse Server SDK wandelt gescannte Belege, Rechnungen und Formulare direkt in Ihrer eigenen Infrastruktur in durchsuchbare PDFs und strukturierte JSON- oder XML-Daten um. Es gibt weder Gebühren pro Seite noch eine Abhängigkeit von der Cloud. Wenn Sie statt unstrukturiertem Text klar benannte Felder benötigen, führen Sie zunächst die OCR aus, um das Dokument in maschinenlesbaren Text umzuwandeln. Übergeben Sie das Ergebnis danach an die Intelligente Datenextraktion. So erhalten Sie mit zwei separaten Aufrufen eine durchgängige Verarbeitungskette.
Wie unterstützt OCR die automatisierte Dokumentenverarbeitung?
OCR wandelt gescannte Belege, Rechnungen und Formulare in maschinenlesbaren Text um. Die Technik erkennt jedoch nicht, welche Zeile die Rechnungsnummer oder welche Zelle den Gesamtbetrag enthält.
Das OCR-Modul des Apryse Server SDK erkennt gedruckten Text in gescannten oder fotografierten Geschäftsdokumenten. Es erstellt eine durchsuchbare PDF-Datei mit auswählbarer Textebene sowie eine JSON- oder XML-Ausgabe mit dem erkannten Text und seiner Position auf der Seite. Die Standard-Engine (V12) unterstützt mehr als 80 Sprachen und läuft auf Ihrem eigenen Server, in Ihrer VPC oder in einer komplett isolierten Umgebung. Bei der OCR-Verarbeitung bleiben alle Dokumente in Ihrer Infrastruktur.
Sobald ein Dokument maschinenlesbar ist, analysiert die intelligente Datenextraktion die OCR-Ausgabe. Sie erkennt Rechnungsnummern, Positionen, Gesamtbeträge und weitere relevante Felder und gibt die Ergebnisse als strukturierte JSON-Daten aus. Diese Seite beschreibt die OCR-Phase. Weitere Informationen finden Sie unter „Intelligente Datenextraktion“.
Architektur: Von OCR zur intelligenten Datenextraktion
Ein gescannter Beleg, eine Rechnung oder ein Formular wird als Bild oder bildbasiertes PDF erfasst. Das OCR-Modul wandelt die Datei in ein durchsuchbares PDF sowie in JSON- oder XML-Daten mit Text- und Positionsdaten um. Anschließend analysiert die Intelligente Datenextraktion diese Daten und liefert klar benannte Felder wie Rechnungsnummer, Positionen, Gesamtbetrag, Lieferantenname und Dokumenttyp.
OCR und Intelligente Datenextraktion sind separate Zusatzmodule, die jeweils eine eigene Lizenz erfordern. OCR wandelt Bilder in maschinenlesbaren Text um. Die Intelligente Datenextraktion bereitet diesen Text als klar gekennzeichnete, strukturierte Daten auf.
Möchten Sie OCR auf Ihrem eigenen Server oder in einer selbst verwalteten Umgebung einsetzen? Weitere Informationen finden Sie im Leitfaden für den selbst verwalteten OCR-Betrieb.
Einschränkungen und Grenzwerte
- OCR erstellt durchsuchbaren Text und Positionsdaten, aber keine strukturierten Felder. Wenn Sie daraus etwa Rechnungsnummern oder Tabellen mit Einzelposten extrahieren möchten, benötigen Sie das separate Zusatzpaket Intelligente Datenextraktion.
- Die Genauigkeit hängt von der Scanqualität ab. Das OCR-Modul ist für Farb- und Graustufenscans mit etwa 300 dpi optimiert.
- Für handschriftlich ausgefüllte Felder, wie sie häufig in Schadensformularen von Versicherungen und in Aufnahmeunterlagen vorkommen, ist das separat erhältliche Add-on Handwriting ICR Module erforderlich. OCR allein kann Handschrift nicht erkennen.
- Das OCR-Modul ist nur für das Apryse Server SDK verfügbar. Im Web SDK und Mobile SDK ist es nicht enthalten.
- Die Erkennung der Textausrichtung ist derzeit für kyrillische, devanagarische und arabische Schriften sowie für Koreanisch nicht verfügbar. Add-on-Module sind nicht mit ARM- oder 32-Bit-Systemen kompatibel.
Apryse OCR-Modul im Vergleich zu anderen OCR-Lösungen
Mit Tesseract lässt sich kostenlos ein erster Prototyp erstellen. Bei realen Dokumenten – etwa schief gescannten Seiten, komplexen Layouts oder Bildern mit geringer Qualität – muss Ihr Team jedoch selbst für die nötige Genauigkeit und laufende Pflege sorgen. Bei Problemen steht zudem kein vertraglich geregelter Support zur Verfügung. Cloud-OCR-Dienste wie AWS Textract, Azure Document Intelligence und Google Document AI senken zwar den Aufwand für den Betrieb, bringen aber andere Nachteile mit sich: Die Kosten steigen durch die Abrechnung pro Seite mit dem Volumen. Außerdem werden Dokumente außerhalb Ihrer eigenen Umgebung verarbeitet. Für sensible Daten oder stark regulierte Branchen sind diese Dienste daher oft ungeeignet. Das OCR-Modul von Apryse nutzt eine auf Deep Learning basierte Engine mit klar reproduzierbaren Ergebnissen und läuft in Ihrer eigenen Infrastruktur. Es unterstützt mehr als 80 Sprachen, bietet planbare Lizenzkosten statt einer Abrechnung pro Seite und sorgt dafür, dass Ihre Dokumente Ihre Umgebung nicht verlassen.
Typische Anwendungsfälle
Finanzdienstleistungen
OCR wandelt gescannte Kontoauszüge, KYC-Unterlagen und Hypothekendokumente in durchsuchbaren Text um. Anschließend erfasst die intelligente Datenextraktion automatisch Kontonummern und Salden.
Versicherungen
Schadenmeldungen (FNOL), Versicherungsunterlagen und Fotos aus dem Außendienst werden vor der strukturierten Datenextraktion in durchsuchbaren Text umgewandelt.
Gesundheitswesen
Laborberichte, Analysezertifikate und Aufnahmeformulare werden in maschinenlesbaren Text umgewandelt und anschließend in klar strukturierten Datenprozessen verarbeitet.
Behörden und öffentlicher Sektor
Scans von FOIA-Dokumenten sowie Genehmigungs- und Steuerformularen werden in durchsuchbaren Text umgewandelt. So lassen sie sich effizient in Archivsysteme und Prozesse zur Schwärzung integrieren.
Logistik
Frachtbriefe, Zolldokumente und Versandrechnungen aus Tausenden von Quellen werden durchsuchbar aufbereitet. Anschließend werden die einzelnen Positionen präzise extrahiert.
Apryse Server SDK: Technische Details
Erfahren Sie alles Wichtige zum Apryse OCR-Modul: wie es funktioniert, welche Vorteile es bietet, welche Laufzeitumgebung und Sprachen es unterstützt und welche Optionen für die Bereitstellung verfügbar sind. Zudem erhalten Sie eine klare Anleitung zur Installation und Einrichtung in Ihrem Tech-Stack.
- Laufzeitumgebung: Nur für das Server SDK verfügbar, nicht für das Web SDK oder Mobile SDK.
- Sprachen und Frameworks: Java, Python, C#/.NET, Node.js, C++, PHP, Ruby, Go
- Plattformen: Windows, Linux und macOS (nur x64)
- Bereitstellungsoptionen: On-Premises, in einer Private Cloud oder VPC sowie ohne Netzwerkanbindung. Dokumente werden lokal verarbeitet und zu keinem Zeitpunkt an Apryse übertragen.
- Installationsoptionen: pip (apryse-ocr, nur für Windows/Linux), Maven (OCRModuleWindows / OCRModuleLinux, groupId com.pdftron, nur für Windows/Linux) oder Entpacken eines Archivs (Windows, Linux, macOS)
- Voraussetzung: Vor jedem Aufruf des OCR-Moduls muss PDFNet.Initialize() mit einem gültigen Lizenzschlüssel ausgeführt werden. Für das Modul ist eine separate Zusatzlizenz erforderlich. Testlizenzen bieten vollen Zugriff.
- Lizenzmodell: Zusatzmodul. Zusätzlich zum Server SDK sind ein separater Download und eine eigene Lizenz erforderlich.
- Dokumentation: docs.apryse.com/core/guides/ocr
Java, Python, .NET, C#, C++ und Node.js
Das Apryse Server SDK bietet native Schnittstellen für Java, Python, C#, C++, Node.js, PHP, Ruby und Go – ohne Wrapper. Das SDK zur intelligenten Datenextraktion lässt sich zusätzlich zu der Schnittstelle installieren, die Sie bereits für das zentrale Server SDK nutzen.


