Dokumentstruktur wiederherstellen und anschließend mit speziell entwickelten Modellen auswerten.
KI-Modelle können Texte zuverlässig analysieren, stoßen bei der Rekonstruktion des ursprünglichen Layouts jedoch an Grenzen. Das gilt besonders für Dokumente mit mehreren Spalten, komplexen Tabellen und gescannten Formularen.
So funktioniert die Wiederherstellung der Dokumentstruktur mit dem Modell
Apryse Intelligente Datenextraktion extrahiert Daten aus Dokumenten in zwei Schritten: Zunächst stellt die Lösung Strukturen wie Lesereihenfolge, Überschriften, Tabellen und Formularfelder präzise wieder her. Danach analysieren speziell entwickelte Modelle die Inhalte, klassifizieren Dokumente, extrahieren Schlüssel-Wert-Paare und geben Tabellendaten aus. Die Verarbeitung erfolgt lokal, in einer Private Cloud oder in einer komplett isolierten Umgebung. Ihre Dokumente bleiben jederzeit in Ihrer Infrastruktur. Die Ergebnisse werden als klar gegliedertes JSON mit Werten zur Sicherheit der Erkennung ausgegeben. Tabellendaten können Sie als JSON- oder Excel-Datei exportieren. Die Lösung lässt sich eigenständig oder als erster Schritt in LLM-Prozessen einsetzen, um die Token-Kosten zu senken.
Warum KI zuerst die Struktur von Dokumenten erfassen muss
KI hat die Art, wie Unternehmen Daten aus Dokumenten extrahieren, grundlegend verändert. Eine zentrale Herausforderung bleibt jedoch: Damit KI ein Dokument verstehen kann, muss sie zunächst dessen Struktur erkennen.
Überschriften, Tabellen, Lesereihenfolge, Formularfelder und die Beziehungen zwischen den Elementen bilden den Kontext, der den Informationen ihre Bedeutung gibt. Geht diese Struktur verloren, liefern selbst moderne KI-Modelle weniger verlässliche Ergebnisse.
Deshalb teilt die Intelligente Datenextraktion die Analyse von Dokumenten in zwei klar getrennte Schritte: die Wiederherstellung der Struktur und die Erfassung der Bedeutung.
Die zwei zentralen Aufgaben
Beim Parsing werden Struktur und Layout rekonstruiert. Dabei wird erkannt, wo sich Text befindet, welche Elemente Überschriften oder Tabellen sind und in welcher Reihenfolge die Inhalte einer Seite gelesen werden sollen.
Die Extraktion erfasst den Inhalt: Wie hoch ist der Rechnungsbetrag, um welchen Dokumenttyp handelt es sich und welche Felder sind für den jeweiligen Prozess relevant?
Diese Unterscheidung ist beim Einsatz von KI besonders wichtig. Große Sprachmodelle können Inhalte sehr gut analysieren. Sie sind jedoch nicht dafür ausgelegt, die Struktur komplexer Layouts sicher zu erfassen. Bei Berichten mit mehreren Spalten, Tabellen, Formularen und technischen Dokumenten können wichtige Bezüge verloren gehen, wenn sie in reinen Text umgewandelt werden. Wird zuerst die Struktur erfasst, erhält die KI eine klare und verlässliche Basis für die weitere Verarbeitung.
So funktioniert die Trennung
Intelligente Datenextraktion analysiert Dokumente in zwei Schritten: Zunächst wird die Struktur erkannt, anschließend werden relevante Inhalte extrahiert.
Zunächst stellt die Intelligente Datenextraktion die Struktur des Dokuments zuverlässig wieder her. Dabei erkennt sie Elemente wie Überschriften, Tabellen, Listen, Formularfelder und die Lesereihenfolge. Statt das Dokument auf reinen Text zu reduzieren, erhält sie die Beziehungen zwischen den Daten und damit ihren Kontext.
Das ist wichtig, denn KI-Modelle können Informationen gut interpretieren, komplexe Layouts aber nicht immer zuverlässig und einheitlich erfassen. Wird zuerst die Struktur des Dokuments erkannt, erhält die KI eine klare und präzise Grundlage für die weitere Verarbeitung.
Eine speziell für Dokumente entwickelte KI analysiert anschließend die strukturierten Inhalte und erfasst deren Bedeutung. Sie erkennt Absätze und Dokumenttypen, extrahiert relevante Werte und bereitet Daten in Tabellenform auf.
Die Strukturerkennung zeigt, wo Informationen im Dokument stehen und wie sie mit anderen Inhalten verknüpft sind. Die KI erkennt ihre Bedeutung. So werden Dokumente in strukturierte Daten umgewandelt, die KI-Systeme direkt verarbeiten können.
Vorteile der kombinierten Architektur
- Dokumentstruktur: Erkennt Kopf- und Fußzeilen, Listen sowie Absätze. Ideal für Screenreader, die gezielte Weitergabe von Inhalten und regelkonforme Abläufe.
- Formularfelderkennung: Erkennt Formularfelder in statischen PDFs und wandelt sie in interaktive, ausfüllbare Formulare um.
- Komplexe Tabellen: Erkennt verbundene Zellen und mehrzeilige Überschriften und exportiert die Daten in JSON oder Excel.
- Schlüssel-Wert-Paare: Erkennt die räumliche Beziehung zwischen einer Bezeichnung und dem passenden Wert, etwa „Rechnungsnummer“ und „INV-001“ – ganz ohne feste Bereiche oder Vorlagen.
- Dokumentenklassifizierung: Ordnet Dokumentseiten anhand ihres Inhalts und ihrer Struktur passenden Kategorien zu.
- CAD-Schriftfeldextraktion: Für die präzise Extraktion von Schlüssel-Wert-Paaren aus Schriftfeldern in CAD-Plänen und technischen Zeichnungen optimiert.
Die Ausgabe erfolgt als JSON mit Seitenzahlen und Koordinaten und lässt sich für weitere Prozesse in jedes gewünschte Format umwandeln. So können Sie die Daten für Suche, Abruf, Analysen und andere LLM-Prozesse optimieren. Da die Struktur des Dokuments erhalten bleibt, erhält die KI präzise Daten – anders als bei reinem Text.
Anwendungsfälle für OCR und ICR
Nicht jedes Dokument liegt von Anfang an als maschinenlesbarer Text vor. Das OCR-Modul und das ICR-Modul zur Erkennung von Handschrift wandeln gescannte Seiten und handschriftliche Inhalte in digitalen Text um. Anschließend lassen sich die Daten gezielt extrahieren.
Was kostet die Datenextraktion aus Dokumenten tatsächlich?
Die Kosten richten sich nach zwei Faktoren: dem Rechenaufwand des gewählten Verfahrens und dem Preis je Recheneinheit.

Compute and hosting
A purpose-built engine reads document geometry on CPU. A general-purpose model needs far more compute, typically on a GPU, regardless of who hosts it. Self-hosting on infrastructure you already own runs close to the cost of electricity. A cloud API bundles that same compute with software, margin, and per-page fees into every call.
Token cost
Send a full document to an LLM, and you pay to process every token in it, whether or not it contains the data you're looking for. Smart Data Extraction can pull out the relevant fields first, so every token you send the LLM is one it actually needs. You're paying for data, not documents.
Wo sollte die Datenextraktion aus Dokumenten erfolgen?
On-Premises oder in der Cloud?
Intelligente Datenextraktion läuft direkt auf Ihrer Infrastruktur. Nutzen Sie dafür einen lokalen Server, eine selbst verwaltete Cloud-VM, einen Container oder eine vollständig isolierte Umgebung ohne Netzwerkzugriff. Ihre Dokumente bleiben bei jeder Konfiguration sicher in Ihrer Umgebung.
Bei der Cloud-API eines Hyperscalers wie AWS oder Google werden Ihre Dokumente dagegen aus Ihrer Umgebung übertragen, bevor die Datenextraktion beginnt.
Für eine Bank, die eingereichte Unterlagen prüft, oder ein Krankenhaus, das Patientenakten verarbeitet, ist dies weit mehr als ein technisches Detail. Es kann darüber entscheiden, ob ein Compliance-Audit bestanden wird. Da KI immer häufiger produktiv eingesetzt wird und strengere Vorgaben gelten, fordern IT-Teams bereits vor Vertragsabschluss, dass Dokumente jederzeit in der eigenen Umgebung bleiben. Mehr zu dieser Entwicklung erfahren Sie in „Wenn KI, Compliance und Cloud-Kosten aufeinandertreffen“ und in unserem „Vergleich: Intelligente Datenextraktion vor Ort oder in der Cloud“.
Bereinigte Eingabedaten sind vor der Extraktion entscheidend für präzise Ergebnisse und die Einhaltung von Vorgaben
Die Qualität der Extraktion hängt von den Quelldokumenten ab. Unterschiedliche Dateiformate, PDFs mit mehreren Dokumenten, gescannte Seiten ohne auswählbaren Text und sensible Daten, die Ihre Systeme nicht verlassen dürfen, müssen vor der Extraktion passend aufbereitet werden.
Mit Add-ons für das Server-SDK, das auch die intelligente Datenextraktion ermöglicht, können Entwickler Dokumente für hohe Genauigkeit und die Einhaltung geltender Vorgaben vorbereiten. Dafür stehen folgende Funktionen zur Verfügung:
- Verschiedene Dateiformate konvertieren und standardisieren → Konvertierung
- Dateien zusammenführen, aufteilen und Seiten neu anordnen → Seitenbearbeitung
- Sensible Daten vor der Weitergabe von Dokumenten sicher schwärzen → SDK zur Schwärzung
- OCR für gescannte Dokumente und Bilddateien → OCR/ICR