Our Fall Release Arrives October 7th: Get a Sneak Peek Now

OCR für Belege, Rechnungen und Formulare: Leitfaden zum SDK zur Datenextraktion

Das OCR-Modul des Apryse Server SDK wandelt gescannte Belege, Rechnungen und Formulare direkt in Ihrer eigenen Infrastruktur in durchsuchbare PDFs und strukturierte JSON- oder XML-Daten um. Es gibt weder Gebühren pro Seite noch eine Abhängigkeit von der Cloud. Wenn Sie statt unstrukturiertem Text klar benannte Felder benötigen, führen Sie zunächst die OCR aus, um das Dokument in maschinenlesbaren Text umzuwandeln. Übergeben Sie das Ergebnis danach an die Intelligente Datenextraktion. So erhalten Sie mit zwei separaten Aufrufen eine durchgängige Verarbeitungskette.

Wie unterstützt OCR die automatisierte Dokumentenverarbeitung?

OCR wandelt gescannte Belege, Rechnungen und Formulare in maschinenlesbaren Text um. Die Technik erkennt jedoch nicht, welche Zeile die Rechnungsnummer oder welche Zelle den Gesamtbetrag enthält.

Das OCR-Modul des Apryse Server SDK erkennt gedruckten Text in gescannten oder fotografierten Geschäftsdokumenten. Es erstellt eine durchsuchbare PDF-Datei mit auswählbarer Textebene sowie eine JSON- oder XML-Ausgabe mit dem erkannten Text und seiner Position auf der Seite. Die Standard-Engine (V12) unterstützt mehr als 80 Sprachen und läuft auf Ihrem eigenen Server, in Ihrer VPC oder in einer komplett isolierten Umgebung. Bei der OCR-Verarbeitung bleiben alle Dokumente in Ihrer Infrastruktur.

Sobald ein Dokument maschinenlesbar ist, analysiert die intelligente Datenextraktion die OCR-Ausgabe. Sie erkennt Rechnungsnummern, Positionen, Gesamtbeträge und weitere relevante Felder und gibt die Ergebnisse als strukturierte JSON-Daten aus. Diese Seite beschreibt die OCR-Phase. Weitere Informationen finden Sie unter „Intelligente Datenextraktion“.

Architektur: Von OCR zur intelligenten Datenextraktion

Ein gescannter Beleg, eine Rechnung oder ein Formular wird als Bild oder bildbasiertes PDF erfasst. Das OCR-Modul wandelt die Datei in ein durchsuchbares PDF sowie in JSON- oder XML-Daten mit Text- und Positionsdaten um. Anschließend analysiert die Intelligente Datenextraktion diese Daten und liefert klar benannte Felder wie Rechnungsnummer, Positionen, Gesamtbetrag, Lieferantenname und Dokumenttyp.

OCR und Intelligente Datenextraktion sind separate Zusatzmodule, die jeweils eine eigene Lizenz erfordern. OCR wandelt Bilder in maschinenlesbaren Text um. Die Intelligente Datenextraktion bereitet diesen Text als klar gekennzeichnete, strukturierte Daten auf.

Möchten Sie OCR auf Ihrem eigenen Server oder in einer selbst verwalteten Umgebung einsetzen? Weitere Informationen finden Sie im Leitfaden für den selbst verwalteten OCR-Betrieb.

Einschränkungen und Grenzwerte

  • OCR erstellt durchsuchbaren Text und Positionsdaten, aber keine strukturierten Felder. Wenn Sie daraus etwa Rechnungsnummern oder Tabellen mit Einzelposten extrahieren möchten, benötigen Sie das separate Zusatzpaket Intelligente Datenextraktion.
  • Die Genauigkeit hängt von der Scanqualität ab. Das OCR-Modul ist für Farb- und Graustufenscans mit etwa 300 dpi optimiert.
  • Für handschriftlich ausgefüllte Felder, wie sie häufig in Schadensformularen von Versicherungen und in Aufnahmeunterlagen vorkommen, ist das separat erhältliche Add-on Handwriting ICR Module erforderlich. OCR allein kann Handschrift nicht erkennen.
  • Das OCR-Modul ist nur für das Apryse Server SDK verfügbar. Im Web SDK und Mobile SDK ist es nicht enthalten.
  • Die Erkennung der Textausrichtung ist derzeit für kyrillische, devanagarische und arabische Schriften sowie für Koreanisch nicht verfügbar. Add-on-Module sind nicht mit ARM- oder 32-Bit-Systemen kompatibel.

Apryse OCR-Modul im Vergleich zu anderen OCR-Lösungen

Copied to clipboard

Mit Tesseract lässt sich kostenlos ein erster Prototyp erstellen. Bei realen Dokumenten – etwa schief gescannten Seiten, komplexen Layouts oder Bildern mit geringer Qualität – muss Ihr Team jedoch selbst für die nötige Genauigkeit und laufende Pflege sorgen. Bei Problemen steht zudem kein vertraglich geregelter Support zur Verfügung. Cloud-OCR-Dienste wie AWS Textract, Azure Document Intelligence und Google Document AI senken zwar den Aufwand für den Betrieb, bringen aber andere Nachteile mit sich: Die Kosten steigen durch die Abrechnung pro Seite mit dem Volumen. Außerdem werden Dokumente außerhalb Ihrer eigenen Umgebung verarbeitet. Für sensible Daten oder stark regulierte Branchen sind diese Dienste daher oft ungeeignet. Das OCR-Modul von Apryse nutzt eine auf Deep Learning basierte Engine mit klar reproduzierbaren Ergebnissen und läuft in Ihrer eigenen Infrastruktur. Es unterstützt mehr als 80 Sprachen, bietet planbare Lizenzkosten statt einer Abrechnung pro Seite und sorgt dafür, dass Ihre Dokumente Ihre Umgebung nicht verlassen.

Cloud OCR API
Tesseract (open source)
Apryse OCR Module
Genauigkeit bei Belegen und Rechnungen
Umfassende, verwaltete Vorverarbeitung
Variable, manuelle Vorverarbeitung nötig
Hochpräzise Engine mit Unterstützung für über 80 Sprachen
Extraktion strukturierter Felder
Integriert in
Nein, nur Text
Über das Add-on für Intelligente Datenextraktion
On-Premises / offline
Nein
Ja
Ja
Preise
Pro Seite
Kostenlos
Pauschallizenz und Mengenrabatte

Typische Anwendungsfälle

Sanity Image

Finanzdienstleistungen

OCR wandelt gescannte Kontoauszüge, KYC-Unterlagen und Hypothekendokumente in durchsuchbaren Text um. Anschließend erfasst die intelligente Datenextraktion automatisch Kontonummern und Salden.

Sanity Image

Versicherungen

Schadenmeldungen (FNOL), Versicherungsunterlagen und Fotos aus dem Außendienst werden vor der strukturierten Datenextraktion in durchsuchbaren Text umgewandelt.

Sanity Image

Gesundheitswesen

Laborberichte, Analysezertifikate und Aufnahmeformulare werden in maschinenlesbaren Text umgewandelt und anschließend in klar strukturierten Datenprozessen verarbeitet.

Sanity Image

Behörden und öffentlicher Sektor

Scans von FOIA-Dokumenten sowie Genehmigungs- und Steuerformularen werden in durchsuchbaren Text umgewandelt. So lassen sie sich effizient in Archivsysteme und Prozesse zur Schwärzung integrieren.

Sanity Image

Logistik

Frachtbriefe, Zolldokumente und Versandrechnungen aus Tausenden von Quellen werden durchsuchbar aufbereitet. Anschließend werden die einzelnen Positionen präzise extrahiert.

Apryse Server SDK: Technische Details

Erfahren Sie alles Wichtige zum Apryse OCR-Modul: wie es funktioniert, welche Vorteile es bietet, welche Laufzeitumgebung und Sprachen es unterstützt und welche Optionen für die Bereitstellung verfügbar sind. Zudem erhalten Sie eine klare Anleitung zur Installation und Einrichtung in Ihrem Tech-Stack.

  • Laufzeitumgebung: Nur für das Server SDK verfügbar, nicht für das Web SDK oder Mobile SDK.
  • Sprachen und Frameworks: Java, Python, C#/.NET, Node.js, C++, PHP, Ruby, Go
  • Plattformen: Windows, Linux und macOS (nur x64)
  • Bereitstellungsoptionen: On-Premises, in einer Private Cloud oder VPC sowie ohne Netzwerkanbindung. Dokumente werden lokal verarbeitet und zu keinem Zeitpunkt an Apryse übertragen.
  • Installationsoptionen: pip (apryse-ocr, nur für Windows/Linux), Maven (OCRModuleWindows / OCRModuleLinux, groupId com.pdftron, nur für Windows/Linux) oder Entpacken eines Archivs (Windows, Linux, macOS)
  • Voraussetzung: Vor jedem Aufruf des OCR-Moduls muss PDFNet.Initialize() mit einem gültigen Lizenzschlüssel ausgeführt werden. Für das Modul ist eine separate Zusatzlizenz erforderlich. Testlizenzen bieten vollen Zugriff.
  • Lizenzmodell: Zusatzmodul. Zusätzlich zum Server SDK sind ein separater Download und eine eigene Lizenz erforderlich.
  • Dokumentation: docs.apryse.com/core/guides/ocr
Language and Framework Support

Java, Python, .NET, C#, C++ und Node.js

Das Apryse Server SDK bietet native Schnittstellen für Java, Python, C#, C++, Node.js, PHP, Ruby und Go – ohne Wrapper. Das SDK zur intelligenten Datenextraktion lässt sich zusätzlich zu der Schnittstelle installieren, die Sie bereits für das zentrale Server SDK nutzen.

Sanity Image
Sanity Image
Sanity Image
Sanity Image
Sanity Image
Sanity Image

Häufig gestellte Fragen

Ja. Die Standard-Engine des OCR-Moduls im Server-SDK wandelt gescannte Belege und Rechnungen in durchsuchbare PDFs mit auswählbarer Textebene um. Die intelligente Datenextraktion von Apryse kann zudem mehr als 30 Dokumenttypen automatisch klassifizieren und Daten wie Schlüssel-Wert-Paare aus Dokumenten extrahieren.

Mit dem OCR-Modul von Apryse können Sie gescannte Formulare in den Formaten JPEG, PNG, TIFF oder als bildbasierte PDF-Datei verarbeiten und als durchsuchbare PDF-Datei speichern. Die Textebene wird über das Originalbild gelegt, sodass das Layout des Formulars erhalten bleibt.

Ja. OCR liefert durchsuchbaren Text und Positionsdaten. Um „Rechnungsnummer: INV-001“ als Schlüssel-Wert-Paar zu erkennen, ist jedoch ein separater Schritt mit Intelligenter Datenextraktion erforderlich. Dieses Zusatzpaket nutzt die OCR-Ausgabe als Eingabe.

Die Standard-OCR erkennt gedruckten und digital erzeugten Text. Für handschriftliche Inhalte, ausgefüllte Formularfelder, Unterschriften und Notizen benötigen Sie das separate Zusatzmodul Handwriting ICR Module.

Jetzt starten

Lesen Sie zunächst den OCR-Leitfaden oder entdecken Sie die gesamte Apryse Developer Suite. Erfahren Sie, wie Sie die Texterkennung in umfassende Abläufe zur Dokumentenverarbeitung integrieren können.