EU AI Act deadlines are already in effect: Get the Checklist

OCR im eigenen System: Wenn Cloud-APIs für Dokumente nicht infrage kommen

Cloud-APIs lassen sich einfach integrieren und sind in der Pilotphase kostengünstig. In stark regulierten Branchen verhindern strenge Vorgaben jedoch oft den Einsatz von Abläufen, die von der Cloud abhängen. Auch schwer planbare Kosten pro Seite und Systeme ohne Internetzugang sprechen gegen OCR in der Cloud. Das OCR-Modul des Apryse Server SDK verarbeitet Dokumente vollständig in Ihrer eigenen Infrastruktur. Dabei werden keine Inhalte an Apryse oder Dritte übertragen.

OCR vollständig lokal

Wenn Sie volle Kontrolle über Ihre Dokumente und Daten benötigen, verarbeiten Sie diese direkt in Ihrer eigenen Umgebung. Das Apryse Server SDK OCR Module wird vollständig in Ihrer Infrastruktur ausgeführt – lokal, in einer VPC oder in einer isolierten Umgebung. Es wandelt gescannte Bilder und bildbasierte PDFs in durchsuchbare PDFs mit auswählbarer Textebene um. Zudem liefert es strukturierte JSON- oder XML-Daten mit Text- und Positionsdaten. Schnittstellen sind für Java, Python, C#, C++, Node.js, PHP, Ruby und Go verfügbar. Das Modul ist ein separat lizenziertes Add-on. Ihr Testschlüssel bietet Zugriff auf alle Add-ons. Das SDK unterstützt Windows, Linux und macOS und kommt ohne GPU aus.

Warum Cloud-OCR-APIs die Anforderungen regulierter Branchen oft nicht erfüllen

Ein Dokument, das Sie an eine Cloud-OCR-API senden, verlässt Ihre eigene Umgebung und wird von einem externen Anbieter verarbeitet. Für viele Anwendungen ist dies unkritisch. Bei sensiblen oder regulierten Daten kann es jedoch ein Ausschlusskriterium sein. Im Rahmen von HIPAA muss das Business Associate Agreement auch den OCR-Anbieter einschließen. Bei einer Prüfung von Datentransfers nach DSGVO ist zudem der Standort des Dienstleisters relevant. Auch der Umfang eines SOC-2-Audits wächst mit jeder externen API, die ein Dokument auf dem Weg zu durchsuchbarem Text durchläuft.

Das Preismodell pro Seite ist ein weiterer wichtiger Faktor. In einem Pilotprojekt wirken die Kosten zunächst überschaubar. Bei 100.000 Seiten pro Monat entstehen jedoch laufende Ausgaben, die mit Ihrem Dokumentenvolumen steigen – unabhängig von der Größe Ihres Entwicklungsteams.

Das OCR-Modul des Apryse Server SDK verarbeitet Dokumente direkt in Ihrer eigenen Infrastruktur. Mit der Pauschallizenz bleiben Ihre Kosten unabhängig von der Zahl der verarbeiteten Seiten planbar. So können Sie Ihre Plattform skalieren, ohne dass die OCR-Kosten mit dem Dokumentenvolumen steigen.

OCR-Lösungen im Vergleich

AWS Textract
Google Document AI

Dokumente werden in Ihrer eigenen Infrastruktur verarbeitet

Dokumente werden in der AWS-Cloud verarbeitet

Dokumente werden über die Infrastruktur von Google Cloud verarbeitet

Ihre Daten bleiben in Ihrer Umgebung

Ihre Daten bleiben in Ihrer Umgebung

JaDaten bleiben in Ihrer Umgebung

Unterstützung für lokale und isolierte Umgebungen

Kein Betrieb On-Premises oder in Air-Gap-Umgebungen

On-Premise- und Air-Gap-Betrieb werden nicht unterstützt

Flexible Lizenzmodelle ohne Gebühren pro Seite

Preis pro Seite (0,01–0,015 $)

Preis pro 1.000 Seiten (1,50–30 $)

Keine Datenübertragung an Dritte

Architektur unterstützt HIPAA und DSGVO; eine BAA mit einem Drittanbieter ist erforderlich

Unterstützt eine HIPAA- und DSGVO-konforme Architektur; ein BAA mit einem Drittanbieter ist erforderlich

So funktioniert OCR im eigenen System

Sie können die selbst gehostete OCR auf einem Bare-Metal-Server, einer VM oder in einem Docker-Container innerhalb Ihrer eigenen VPC betreiben. So lassen sich sensible Daten sicher in einer von Ihnen kontrollierten Umgebung verarbeiten.

Jeder Server-SDK-Prozess ruft beim Start einmal PDFNet.initialize() auf, bevor eine andere SDK-Methode ausgeführt wird. Das OCR-Modul wird als Add-on zum Server-SDK geladen. Bei einer Bereitstellung im Container gehört diese Einrichtung in die Startroutine des Containers und nicht in den Request-Handler. Ein Aufruf bei jeder Anfrage erhöht den Aufwand und widerspricht dem Prinzip der einmaligen Einrichtung pro Prozess.

Das Standard-OCR-Modul wird auf der CPU ausgeführt. Da keine GPU nötig ist, bleibt die Container-Konfiguration einfach und kann flexibel auf gängigen Cloud-Instanzen eingesetzt werden. Führen Sie bei Node.js Ihre OCR-Vorgänge mit runWithCleanup aus. So wird der Speicher nach jedem Dokument automatisch freigegeben und muss nicht manuell verwaltet werden.

Einen vollständigen Überblick über die OCR-Funktionen des Server SDK finden Sie unter „Apryse OCR-Funktionen“.

Compliance-Anwendungsfälle: HIPAA, DSGVO und isolierte Bereitstellungen

Selbst gehostete OCR erleichtert die Einhaltung gesetzlicher Vorgaben, da geschützte Gesundheitsdaten (PHI) und persönliche Daten bei OCR-API-Aufrufen in Ihrer eigenen Umgebung bleiben. Das Apryse Server SDK kann Sie bei der Einhaltung der HIPAA-Vorgaben unterstützen, ersetzt jedoch nicht Ihr eigenes Compliance-Programm.

Sanity Image

HIPAA

For HIPAA workflows, PHI stays inside your infrastructure through the entire OCR operation. Pair that with redaction, which removes content at the byte level rather than masking it visually, AES-256 encryption, and access permissions, to build a HIPAA-compliant document pipeline.

GDPR

For GDPR, local processing supports data residency and data minimization requirements directly. There is no third-party data flow through the SDK to account for in a transfer impact assessment, because there is no transfer.

Air-gapped deployments

For air-gapped environments, the SDK operates without network connectivity once deployed. By default, Apryse collects limited API-usage metadata, such as call names, page counts, and SDK version, but never document content. If your environment requires zero outbound traffic, you can request a no-tracking license key. Air-gapped license configuration is handled directly with Apryse, so contact sales to scope that deployment rather than treating it as self-serve.

Apryse is ISO certified

On the certification side, Apryse holds ISO/IEC 27001:2022 certification for its information security management system, held since 2018, and completed a SOC 2 Type II audit in 2024 following its first SOC 2 Type I audit in 2023. Full detail is available on Apryse security and compliance certifications.

Apryse OCR vs. Tesseract: Worauf es beim Einsatz in Unternehmen wirklich ankommt

Tesseract ist kostenlos, steht unter der Apache-Lizenz und eignet sich für einspaltige Dokumente in englischer Sprache, wenn keine Anforderungen an den Einsatz im Unternehmen bestehen. Für viele Prototypen bietet es einen guten Einstieg.

Die Unterschiede zeigen sich, sobald aus einem Prototyp eine produktive Lösung wird. Tesseract erstellt standardmäßig weder eine durchsuchbare PDF-Datei mit Textebene noch eine integrierte JSON- oder XML-Ausgabe mit Positionsdaten. Das OCR-Modul von Apryse liefert beides in einem Schritt: ein durchsuchbares PDF mit auswählbarem Text und strukturierte JSON- oder XML-Daten mit Textinhalten und Koordinaten für die weitere Verarbeitung. Das Standard-OCR-Modul nutzt neuronale Netze und Deep Learning für die Texterkennung statt der klassischen Methode, auf der Tesseract basiert.

Die zweite Lücke zeigt sich bei den Anforderungen von Unternehmen. Tesseract bietet weder ein SLA noch einen Supportvertrag, eine Zertifizierung nach SOC 2 oder ISO 27001 oder eine Haftungsfreistellung für den Einsatz im Unternehmen. Diese Nachweise sind bei Einkaufs- und Sicherheitsprüfungen oft Pflicht. Ohne sie ist es deutlich schwerer, Ihre Compliance-Vorgaben zu erfüllen.

Für Dokumente mit komplexen Layouts, die über den Umfang des Standard-OCR-Moduls hinausgehen, bietet Apryse auch das IRIS OCR Module an. Dieses eigenständige Produkt wird separat lizenziert. Kontaktieren Sie Apryse, um zu prüfen, ob es für Ihre Dokumente geeignet ist.

Erfahren Sie mehr darüber, wie sich KI-gestützte OCR von klassischer OCR unterscheidet, und gewinnen Sie einen klaren Überblick darüber, wie OCR im Vergleich zu modernen Verfahren der Datenextraktion einzuordnen ist.

Language Support

Java, Python, .NET, C#, C++ und Node.js

Das Apryse Server SDK bietet native Schnittstellen – ohne Wrapper – für Java, Python, C#, C++, Node.js, PHP, Ruby und Go. Das OCR-Modul lässt sich zusätzlich zu der Schnittstelle installieren, die Sie bereits für das Server SDK nutzen.

Sanity Image
Sanity Image
Sanity Image
Sanity Image
Sanity Image
Sanity Image

Ausgabeformate: durchsuchbare PDF-Dateien, JSON und XML

Ein einziger OCR-Vorgang liefert zwei direkt nutzbare Ergebnisse. Zum einen entsteht eine durchsuchbare PDF-Datei: Das gescannte Originalbild wird um eine auswählbare und durchsuchbare Textebene ergänzt. Zum anderen erhalten Sie eine strukturierte JSON- oder XML-Datei mit dem erkannten Text, den zugehörigen Koordinaten und den Seitenzahlen. Diese Daten lassen sich nahtlos in KI-, Analyse- und Abläufe zur Automatisierung integrieren, sind jedoch nicht für die direkte Anzeige vorgesehen.

Als Eingabeformate werden JPEG, PNG, TIFF, BMP und bildbasierte PDFs unterstützt. Die besten Ergebnisse erzielen Sie mit Farb- oder Graustufenbildern bei etwa 300 DPI. Auch Scans mit geringerer Auflösung lassen sich verarbeiten. Die Genauigkeit hängt jedoch von der Qualität des Ausgangsbildes ab.

Wie Sie Ihre Quelldokumente für eine möglichst genaue Erkennung optimieren, erfahren Sie unter Warum eine gute Dokumentvorbereitung mehr als OCR erfordert.

Häufig gestellte Fragen

Cloud-OCR-APIs verarbeiten Dokumente in der Infrastruktur externer Anbieter. Bei geschützten Gesundheitsdaten (PHI), personenbezogenen Daten (PII) oder regulierten Finanzdaten kann jeder API-Aufruf die Datenresidenz und Compliance beeinflussen. Mit selbst gehosteten OCR-Lösungen bleiben diese Daten in Ihrer eigenen Umgebung und werden nicht an Dritte übertragen.

PHI wird während der OCR zu keinem Zeitpunkt an Systeme von Apryse übertragen. In Verbindung mit Schwärzung auf Byte-Ebene, AES-256-Verschlüsselung und klaren Zugriffsrechten schafft das SDK eine sichere Basis für HIPAA-konforme Abläufe. Das Apryse Server SDK unterstützt Sie dabei, die HIPAA-Vorgaben einzuhalten. Es ist nicht HIPAA-zertifiziert, da eine solche Zertifizierung für SDK-Anbieter grundsätzlich nicht möglich ist.

Amazon Textract kostet 0,01 bis 0,015 US-Dollar pro Seite. Google Document AI berechnet 1,50 bis 30 US-Dollar pro 1.000 Seiten, zuzüglich Hosting-Kosten. Bei 100.000 Seiten pro Monat steigen diese Kosten mit dem Volumen. Apryse bietet das OCR-Modul des Server-SDK zu einem Festpreis an. So sinken die Kosten pro Seite, je mehr Dokumente Sie verarbeiten.

Ja. Nach der Bereitstellung funktioniert das SDK auch ohne Netzwerkzugang. Standardmäßig erfasst es nur wenige Metadaten zur API-Nutzung, jedoch keine Inhalte aus Dokumenten. Auf Anfrage erhalten Sie einen Lizenzschlüssel, der das Tracking vollständig deaktiviert. Lizenzen für komplett isolierte Umgebungen erhalten Sie über den Apryse-Vertrieb. Eine Self-Service-Option ist dafür nicht verfügbar.

Tesseract eignet sich gut für einspaltige Dokumente in englischer Sprache und ist kostenlos. Es bietet jedoch weder PDFs mit Anmerkungen noch eine strukturierte Ausgabe im JSON- oder XML-Format. Zudem fehlen ein SLA und Nachweise zur Compliance. Das Apryse OCR Module erstellt in einem einzigen Schritt durchsuchbare PDFs und strukturierte Daten im JSON- oder XML-Format. Es erfüllt SOC 2 und ISO 27001 und umfasst einen Supportvertrag sowie eine Haftungsfreistellung für den Einsatz im Unternehmen.

Apryse unterstützt Java, Python, C#, C++, Node.js, PHP, Ruby und Go über native Schnittstellen. Die Paketnamen lauten: com.pdftron in Maven für Java, apryse-ocr in pip für Python und @pdftron/ocr in npm für Node.js. Vor jedem OCR-Aufruf müssen Sie je nach Sprache PDFNet.initialize() oder PDFNet.Initialize() ausführen.

Ein einziger OCR-Vorgang erstellt sowohl eine durchsuchbare PDF-Datei mit auswählbarer Textebene als auch strukturierte JSON- oder XML-Daten mit Text, Begrenzungsrahmen und Seitenzahlen. Unterstützt werden JPEG, PNG, TIFF, BMP und bildbasierte PDF-Dateien.

Ja. Die Lösung läuft unter Linux in Containern und benötigt keine GPU. Rufen Sie PDFNet.initialize() einmal beim Start des Containers auf, nicht bei jeder Anfrage. Verwenden Sie in Node.js runWithCleanup, um Speicherlecks bei der Verarbeitung mehrerer Dokumente zu vermeiden.

Code Samples

Erste Schritte mit der OCR von Apryse

Jedes Beispiel initialisiert das SDK, öffnet eine bildbasierte PDF-Datei, führt eine Texterkennung (OCR) durch und speichert das Ergebnis als durchsuchbare PDF-Datei. Dafür ist das Add-on OCR Module erforderlich. Es muss separat vom Server SDK heruntergeladen werden.

In der Kurzanleitung erfahren Sie, wie Sie das SDK für Ihr Framework herunterladen und installieren. Dort finden Sie auch weitere Codebeispiele.

Java

Copied to clipboard

Python

Copied to clipboard

C#

Copied to clipboard

Node.js

Copied to clipboard

Informationen zur Umsetzung mit C++, PHP, Ruby oder Go finden Sie im Leitfaden zur OCR-Integration. Dort finden Sie passende Codebeispiele für Ihre Programmiersprache.

Erste Schritte

OCR ist ein Zusatzmodul für das Apryse Server SDK. Einen Schlüssel für Ihre kostenlose Testversion erhalten Sie unter dev.apryse.com. Weitere Details finden Sie in der vollständigen Dokumentation.