EU AI Act deadlines are already in effect: Get the Checklist

Integrierte OCR macht Scans und bildbasierte PDFs durchsuchbar und wandelt Inhalte in maschinenlesbaren Text um

Apryse OCR wandelt gescannte PDFs in durchsuchbare PDF-Dateien und strukturierten Text mit Positionsdaten um – in mehr als 80 Sprachen. Als Add-on für das Apryse Server SDK läuft die Lösung direkt in Ihrer Anwendung und auf Ihrer eigenen Infrastruktur. Ihre Dokumente bleiben jederzeit in Ihrer Umgebung.

Kompatibel mit Ihrem Tech-Stack

Apryse OCR lässt sich nativ in die Programmiersprachen und Umgebungen integrieren, die Ihr Team bereits nutzt. Native Schnittstellen sind für C++, C# (.NET), Java, Python, Node.js, Go, PHP, Ruby, VB und Objective-C verfügbar. Unterstützt werden Windows, Linux und macOS auf x64-Systemen. Die Unterstützung für ARM folgt in Kürze.

Node.js und Python installieren Sie unter Windows und Linux über npm bzw. pip, Java über Maven. Für C/C++ und weitere Sprachen entpacken Sie das Modularchiv einfach in das Verzeichnis Ihres vorhandenen SDKs.

npm install @pdftron/ocr

pip install --extra-index-url=https://pypi.apryse.com apryse-ocr

PDFNet.Initialize() muss vor jedem OCR-Vorgang aufgerufen werden. Die Beispiel-App OCRTest ist im Hauptpaket des SDK enthalten.

Installieren Sie Node.js und Python unter Windows und Linux über npm bzw. pip und Java über Maven. Für C/C++ und weitere Sprachen entpacken Sie das Modularchiv in das Verzeichnis Ihres vorhandenen SDKs. Rufen Sie PDFNet.Initialize() vor jedem OCR-Vorgang auf.

Mit nur zwei Aufrufen machen Sie eine gescannte PDF durchsuchbar: Legen Sie zuerst die Sprache fest und führen Sie dann das Modul aus.

Bewährt für Dokumenten-Workflows, bei denen Präzision, Kontrolle und flexible Optionen für den Betrieb entscheidend sind.

autodesk logo
boeing logo
notability logo
docusign logo
egress logo
microsoft logo
thomson_reuters logo
encode logo
ibm logo
autodesk logo
boeing logo
notability logo
docusign logo
egress logo
microsoft logo
thomson_reuters logo
encode logo
ibm logo

OCR im Überblick

Copied to clipboard

Apryse OCR ist ein integrierbares, selbst gehostetes OCR-SDK zur optischen Zeichenerkennung im Offline-Betrieb. Es verarbeitet gescannte Bilder und bildbasierte PDFs und erkennt gedruckten sowie maschinell erstellten Text. Als Ergebnis liefert es entweder durchsuchbare PDFs mit auswählbarer Textebene oder klar gegliederten Text mit Positionsdaten zur weiteren Verarbeitung.

Capability
What it does
Durchsuchbare PDF-Datei
Fügt gescannten Bildern und bildbasierten PDFs eine unsichtbare, auswählbare Textebene hinzu. So lassen sich Dokumente durchsuchen und Texte daraus kopieren.
Strukturierte Textausgabe
Gibt OCR-Ergebnisse als JSON oder XML mit Text- und Positionsdaten aus – bereit für Indizierung, Suche, Anmerkungen oder die Verarbeitung in einer KI-Pipeline.
Unterstützte Bildformate
Unterstützt JPEG, PNG, TIFF, BMP und weitere gängige Bildformate sowie PDFs, die nur Rasterbilder enthalten. Zur Verarbeitung der Formate wird intern pdftron.PDF.Convert.ToPdf verwendet.
Unterstützte Sprachen
Mehr als 80 Sprachen mit lateinischer, kyrillischer, arabischer, Devanagari- und CJK-Schrift sowie weiteren Schriftsystemen. Auch mehrere Sprachen in einem Dokument werden erkannt. Für die Kombination von Sprachen gelten die folgenden Regeln.
Zonensteuerung
Verarbeiten Sie nur einen bestimmten Bereich oder schließen Sie gezielt Bereiche aus, etwa um ein Bild in der Seitenleiste einer sonst textreichen Seite zu ignorieren.
Verarbeitung nur über die CPU
Das Standardmodul nutzt neuronale Netze und Deep Learning, benötigt jedoch keine GPU.
Selbst gehostet
Wird direkt in Ihrer Anwendung auf einer von Ihnen kontrollierten Infrastruktur ausgeführt. Dokumente werden weder an Apryse noch an Dritte übertragen.

Ausgabe

Copied to clipboard

OCR liefert zwei Ergebnisse: eine PDF-Datei mit unsichtbarer, auswählbarer Textebene und strukturierte Textdaten, die Sie unabhängig von der PDF-Datei nutzen können.

Output
Format
Produced by
Durchsuchbares PDF
PDF mit unsichtbarer, auswählbarer Textebene
OCRModule.ProcessPDF / OCRModule.ImageToPDF
Strukturierter Text mit Koordinaten
JSON
OCRModule.GetOCRJsonFromImage / GetOCRJsonFromPDF
Strukturierter Text und Koordinaten
XML
OCRModule.GetOCRXmlFromImage / GetOCRXmlFromPDF

Strukturierte Ausgabe

Die strukturierte Ausgabe folgt einer klaren Hierarchie: Seiten enthalten Absätze, Absätze enthalten Zeilen und Zeilen enthalten einzelne Wörter. Für jede Seite werden die Seitennummer, die Auflösung in DPI und der Ursprung des Koordinatensystems angegeben. Dieser liegt oben links oder bei PDFs unten links. Für jedes Wort enthält die Ausgabe die x- und y-Koordinaten des Begrenzungsrahmens sowie Länge, Schriftgröße, Text und Ausrichtung. Optional lässt sich auch für jede Zeile ein Begrenzungsrahmen ausgeben.

Diese Struktur sorgt für transparente und prüfbare Ergebnisse: Jedes erkannte Wort lässt sich einer genauen Position auf der Seite zuordnen. So können Sie es direkt einblenden, hervorheben oder prüfen, bevor es als verlässlich eingestuft wird.

Da die Ausgabe als PDF vorliegt, können Sie sie direkt mit den weiteren Funktionen des Server SDK verarbeiten. Die Umwandlung einer durchsuchbaren PDF-Datei in PDF/A ist im Basispaket enthalten. Für die Umwandlung in DOCX, XLSX, PPTX oder HTML benötigen Sie das Structured Output Module, ein separates Add-on für dasselbe SDK.

Unterstützte Sprachen und Sprachkombinationen

Das OCR-Modul enthält für Englisch optimierte Modelle sowie mehrsprachige Modelle für über 80 Sprachen aus sechs Schriftgruppen: Lateinisch, Kyrillisch, CJK, Devanagari, Arabisch und weitere Schriften wie Griechisch, Georgisch, Tamil, Telugu und Thai.

In einem Dokument lassen sich mehrere Sprachen erkennen. Dabei gelten folgende Regeln:

  • Englisch lässt sich mit jeder anderen Sprache kombinieren.
  • Sprachen mit demselben Schriftsystem lassen sich miteinander kombinieren, zum Beispiel alle Sprachen mit lateinischer Schrift.
  • Koreanisch lässt sich nur mit Englisch kombinieren.
  • Sprachen der Gruppe „Sonstige“ lassen sich nicht untereinander, sondern nur mit Englisch kombinieren.
  • Alle anderen Kombinationen führen zu einem Fehler.

Die Erkennung der Textausrichtung wird für kyrillische, devanagarische und arabische Schriften sowie für Koreanisch nicht unterstützt.

Wann der Einsatz von OCR sinnvoll ist

Wenn gescannte Dokumente, Faxe, fotografierte Seiten oder reine Bild-PDFs die Suche, Indizierung, Datenextraktion oder Barrierefreiheit in Ihrer Anwendung erschweren und nicht an einen öffentlichen Cloud-Dienst übertragen werden dürfen, führen Sie OCR direkt in Ihrer Anwendung aus – auf Ihrer eigenen Infrastruktur und CPU. Für handschriftliche Inhalte steht das Handwriting ICR Module zur Verfügung. Wenn Sie neben Text auch Tabellen, Schlüssel-Wert-Paare und Formularfelder extrahieren oder Dokumente klassifizieren möchten, nutzen Sie die Intelligente Datenextraktion. Zuvor lassen sich die Dokumente aufbereiten, etwa durch Begradigung, Fleckenentfernung und Korrektur der Seitenausrichtung. OCR kann dabei als Teil der Verarbeitung ausgeführt werden.

So funktioniert es

OCR ist ein Zusatzmodul für das Apryse Server SDK. Laden Sie das Modul herunter, installieren Sie es mit dem SDK und nutzen Sie es über dieselbe API wie für Ihre übrige Dokumentenverarbeitung.

Übergeben Sie die Seite

Übergeben Sie ein gescanntes Bild, mehrere Bilder oder eine bildbasierte PDF-Datei. Das Modul wandelt unterstützte Bildformate intern in PDF um, sodass alle Eingaben einheitlich verarbeitet werden.

Sprachen und Regionen festlegen

Wählen Sie eine oder mehrere Zielsprachen aus und legen Sie fest, welche Bereiche erkannt oder ausgeschlossen werden sollen. Wenn die Auflösung der Quelldatei bekannt ist, können Sie zudem den DPI-Wert für die Eingabe anpassen.

Erkennung

Die Engine erkennt Zeichen und ihre genaue Position auf der Seite. Die Verarbeitung erfolgt sicher auf der CPU in Ihrer eigenen Umgebung. Seiteninhalte werden nicht hochgeladen.

Ausgabe integrieren

Fügen Sie die Ergebnisse als unsichtbare Textebene in die PDF-Datei ein, um sie durchsuchbar zu machen. Alternativ können Sie JSON- oder XML-Daten mit Positionsdaten für jedes Wort abrufen – zur Prüfung, Indexierung, Überlagerung oder weiteren Extraktion.

Typischer Ablauf

Gescanntes Bild oder bildbasiertes PDF → Format umwandeln → Sprache, Bereich und DPI festlegen → Text erkennen → Ergebnisse als JSON oder XML prüfen → durchsuchbares PDF erstellen → an Suchindex, Datenbank, Pipeline zur Datenextraktion oder LLM übergeben.

Apryse OCR im Vergleich zu anderen Lösungen

Teams, die OCR in ihre Anwendung integrieren möchten, prüfen meist vier Optionen: eine cloudbasierte OCR-API, eine Open-Source-Engine, eine IDP-Plattform für Unternehmen oder ein vielseitiges KI-Modell. Apryse OCR setzt dagegen auf ein direkt eingebettetes SDK.

Vorteile gegenüber einer cloudbasierten OCR-API

Copied to clipboard

Eine Cloud-API überträgt jede Seite an eine externe Infrastruktur, die sich Ihrer Kontrolle entzieht. Auch ein Offline-Betrieb ohne Netzwerk ist nicht möglich. Apryse OCR läuft dagegen direkt in Ihrer Anwendung und auf Ihren eigenen Servern. Für Unternehmen, die sensible, vertrauliche oder personenbezogene Daten verarbeiten oder Vorgaben zum Speicherort der Daten einhalten müssen, ist dies oft ein entscheidender Vorteil.

Vorteile gegenüber Open-Source-OCR-Engines

Copied to clipboard

Open-Source-Engines sind zwar kostenlos, können im Betrieb jedoch hohe Kosten verursachen. Ihr Team muss sich selbst um Optimierung, Vorverarbeitung, Sprachpakete, Ausgabeformate, Updates und eine sinkende Erkennungsrate kümmern. Apryse OCR ist ein kommerziell betreutes Modul, das durchsuchbare PDFs sowie JSON- und XML-Dateien ausgibt. Es ist in dasselbe Dokumenten-SDK integriert, das auch Ihre weiteren Abläufe rund um Dokumente abdeckt. So können Sie Lizenzkosten klar gegen den Aufwand für Entwicklung und Wartung abwägen.

Vorteile gegenüber einer IDP-Plattform

Copied to clipboard

IDP-Plattformen sind auf die Abläufe von Fachanwendern ausgelegt und bieten Funktionen wie Warteschlangen, Prüfansichten und Low-Code-Konfiguration. Apryse OCR ist dagegen ein SDK-Modul, das sich direkt in Anwendungen integrieren lässt. So können Entwickler die Texterkennung in der eigenen Anwendung steuern, ohne Dokumente an ein separates System zu übertragen.

Vorteile gegenüber einem universellen KI-Modell

Copied to clipboard

Ein universell einsetzbares LLM kombiniert OCR, Datenextraktion und Auswertung. Dadurch sind die Ergebnisse oft weniger gut planbar. Apryse OCR liefert auf Ihrer CPU prüfbare Texte mit Positionsdaten, ohne Seiten an einen externen KI-Anbieter zu senden. Wenn Sie OCR vorab einsetzen, senken Sie zudem die Kosten: KI-Modelle verarbeiten Text deutlich besser als Seitenbilder. Das spart Tokens und liefert zugleich saubere Eingabedaten.

KI-gestützte OCR für Dokumente im Praxiseinsatz

Erfahren Sie, wie gemischte Dokumentenpakete automatisch klassifiziert, getrennt und verarbeitet werden. Wichtige Daten werden mit Angaben zur Zuverlässigkeit extrahiert und strukturiert für weitere Abläufe bereitgestellt.

Implementierung und Integration

Copied to clipboard

Apryse OCR lässt sich direkt in Ihre Anwendung integrieren und wird in einer Infrastruktur ausgeführt, die Ihr Unternehmen kontrolliert.

Attribute
Details
Integrationsmodell
Zusatzmodul für das Apryse Server SDK zur direkten Einbindung in Ihre Anwendung.
Verfügbare SDKs
Nur für das Server-SDK. Dieses Modul ist nicht für das Web-SDK oder Mobile-SDK verfügbar.
Unterstützte Betriebssysteme
Windows, Linux und macOS (x64). ARM- und 32-Bit-Systeme werden nicht unterstützt.
Sprachen und Schnittstellen
.NET, Java, Python, Node.js, C++, Go, PHP, Ruby, Objective-C
Installation
Node.js über npm und Python über pip (Windows und Linux), Java über Maven sowie C/C++ und weitere Sprachen durch Entpacken des Modularchivs in das SDK-Verzeichnis.
Eingabeformate
JPEG, PNG, TIFF, BMP und weitere gängige Bildformate sowie PDFs, die nur Rasterbilder enthalten.
Ausgabe
Durchsuchbares PDF mit auswählbarer Textebene oder JSON/XML mit Text- und Positionsdaten.
Hardware
Nur CPU. Keine GPU erforderlich.
Beispiel-App
OCRTest, im Download des Haupt-SDK enthalten.
Lizenzierung
Lizenz für ein Zusatzpaket des Apryse Server SDK. Testschlüssel bieten vollen Zugriff auf alle Zusatzmodule.

Ihre Dokumente werden sicher in Ihrer eigenen Umgebung verarbeitet und nicht an Apryse oder Dritte übertragen.

Typische Anwendungsfälle

Nutzen Sie OCR überall dort, wo bildbasierte Dokumente in eine Anwendung importiert und in durchsuchbaren Text umgewandelt werden müssen – etwa in Systemen zur Datenverwaltung, bei der Bearbeitung von Versicherungsfällen und Kreditanträgen sowie in Vertragsarchiven, anderen Archiven und Suchindizes.

Sanity Image

Finanzdienstleistungen

Wandeln Sie gescannte Schecks, Kontoauszüge und weitere Bankunterlagen in durchsuchbare, maschinenlesbare Daten um und automatisieren Sie so die Datenerfassung.

Sanity Image

Versicherungen

Extrahieren Sie Daten aus gescannten Schadenakten, Formularen und weiteren Dokumenten, um Inhalte zu indexieren und automatisch an die richtigen Systeme weiterzuleiten.

Sanity Image

Recht

Machen Sie gescannte Beweisdokumente, Korrespondenz und Fallakten in einer kontrollierten Umgebung vollständig durchsuchbar.

Sanity Image

Gesundheitswesen und Life Sciences

Wandeln Sie gescannte klinische und administrative Dokumente in durchsuchbaren Text um – sicher in Ihrer privaten Umgebung.

Sanity Image

Behörden und öffentlicher Sektor

Digitalisieren Sie gescannte Archive und Dokumente, um Inhalte zu durchsuchen, zu indexieren und sicher lokal zu speichern.

Sanity Image

Logistik und Handel

Extrahieren Sie Daten aus Rechnungen, Versandpapieren und Zolldokumenten – auch aus Scans verschiedener Quellen.

Sanity Image

Barrierefreiheit

Fügen Sie gescannten Dokumenten auswählbare Textebenen hinzu, damit Screenreader und andere Hilfstechnologien auf die Inhalte zugreifen können.

Häufig gestellte Fragen

Apryse OCR ist ein selbst gehostetes Zusatzmodul für das Apryse Server SDK. Es wandelt gescannte Bilder und bildbasierte PDFs in maschinenlesbaren Text um. Das Modul erstellt durchsuchbare PDFs mit auswählbarer Textebene oder strukturierte Daten im JSON- und XML-Format mit Angaben zu Text und Position. Es läuft direkt in Ihrer Anwendung und auf einer Infrastruktur, die Sie selbst kontrollieren.

Nein. Die OCR läuft direkt in Ihrer Anwendung und auf Ihrer eigenen Infrastruktur. Ihre Dokumentseiten werden weder an Apryse noch an Dritte zur Verarbeitung übermittelt.

Das Standard-OCR-Modul unterstützt mehr als 80 Sprachen mit lateinischer, kyrillischer, arabischer, CJK- und Devanagari-Schrift. Weitere unterstützte Schriften sind Griechisch, Georgisch, Tamil, Telugu und Thai. Das alternative OCR-Modul unterstützt Englisch, Französisch, Deutsch, Italienisch, Spanisch und Russisch. IRIS OCR erweitert die Auswahl um Chinesisch, Japanisch und Koreanisch.

Starten Sie mit dem Standard-OCR-Modul. Es bietet die höchste Genauigkeit, unterstützt die meisten Sprachen und benötigt keine GPU. Wählen Sie das alternative OCR-Modul, wenn kurze Laufzeiten und ein geringer Speicherbedarf wichtiger sind als maximale Genauigkeit. IRIS OCR eignet sich für Seiten mit mehreren getrennten Textbereichen, etwa Titelseiten von Zeitschriften oder CAD-Zeichnungen.

Ja, mit einigen Einschränkungen. Englisch lässt sich mit jeder anderen Sprache kombinieren. Auch Sprachen aus derselben Schriftgruppe können gemeinsam verwendet werden. Koreanisch kann nur mit Englisch kombiniert werden. Sprachen der Gruppe „Sonstige“ lassen sich ebenfalls nur mit Englisch und nicht untereinander kombinieren. Bei allen anderen Kombinationen wird eine Fehlermeldung ausgegeben.

Optimal ist ein Farb- oder Graustufenbild mit etwa 300 dpi. Ab Version 12 ist eine Texterkennung auch bei einer Auflösung von nur 75 dpi möglich. Die Qualität der Erkennung hängt jedoch vom Ausgangsmaterial ab. Faktoren wie Auflösung, Kontrast, Schräglage und Bildrauschen können das Ergebnis beeinflussen.

Nein. OCR erkennt gedruckte und digital erstellte Zeichen. Für handschriftliche Inhalte benötigen Sie das Handwriting ICR Module. Es nutzt neuronale Netze, die verschiedene Handschriften zuverlässig erkennen.

Ja. Die Ausgabe im JSON- oder XML-Format enthält Text- und Positionsdaten. So können Sie erkannte Inhalte indizieren, als Ebene einblenden oder zur Verarbeitung von Tabellen, Schlüssel-Wert-Paaren und Formularfeldern an die Intelligente Datenextraktion übergeben, bevor die Daten eine nachgelagerte Anwendung oder ein Modell erreichen. Wenn Sie Seiten vor dem Aufruf des Modells in Text umwandeln, senken Sie zudem die Token-Kosten. Eine als Bild übermittelte Seite benötigt deutlich mehr Tokens als dieselbe Seite im Textformat.

OCR ist ein Modul des Server SDK und wird von Web- und mobilen Apps über den Server aufgerufen. Die erstellte durchsuchbare PDF-Datei lässt sich anschließend mit dem Apryse Web SDK oder Mobile SDK anzeigen und mit Anmerkungen versehen.

Windows, Linux und macOS werden auf x64 unterstützt. Zusatzmodule sind nicht für 32-Bit-Systeme verfügbar. Pakete für Node.js und Python stehen für Windows und Linux bereit. Für andere Sprachen entpacken Sie das Modularchiv in das SDK-Verzeichnis. Die Unterstützung für ARM und Apple-Chips folgt in Kürze.

OCR ist als Zusatzpaket für das Apryse Server SDK erhältlich und erfordert den separaten Download eines Moduls. IRIS OCR ist ebenfalls ein Zusatzpaket, da es eine kommerzielle Engine eines Drittanbieters nutzt. Mit einem Testschlüssel erhalten Sie während der Testphase vollen Zugriff auf alle Zusatzmodule. Kontaktieren Sie Apryse für ein Angebot, das auf Ihre Bereitstellung und die benötigten Funktionen zugeschnitten ist.

Testen Sie es mit Ihren schwierigsten Scans

Laden Sie Ihre eigenen Scans, Faxe und bildbasierten PDFs hoch. Prüfen Sie die Genauigkeit direkt in Ihrer Umgebung und mit den Dokumenten, die Sie tatsächlich verarbeiten – statt mit einem bereinigten Beispieldatensatz. Keine Kreditkarte erforderlich.