Google Document AI vs. Apryse 2026
Google Document AI ist eine Cloud-API, die Dokumente in Text, Layoutinformationen und strukturierte Felder umwandelt. Apryse ist ein integrierbares Dokumenten-SDK, dessen Module für intelligente Datenextraktion, OCR und Handschrifterkennung (ICR) ähnliche Aufgaben innerhalb Ihrer eigenen Infrastruktur übernehmen. Darüber hinaus bietet es umfangreiche Funktionen für Anzeige, Bearbeitung, Konvertierung und Compliance. Diese Seite vergleicht die Überschneidungen beider Lösungen und zeigt klar auf, worin sie sich unterscheiden. So können Sie leichter entscheiden, welche Lösung für Sie geeignet ist.

"The rendering performance, combined with how responsive the Apryse engineering team has been, has made a meaningful difference in our product quality."
Amanda Lansman, Sr Product Manager, Dropbox
Funktionsvergleich: So schneidet Apryse ab
Diese Übersicht enthält nur die Funktionen, die beide Produkte bieten. Funktionen, die ausschließlich Apryse bietet, finden Sie im nächsten Abschnitt.
OCR-Engine und unterstützte Sprachen
Standard-OCR-Modul (SDK 12.0 und höher): Deep-Learning-Engine mit Modellen für Englisch sowie mehrsprachigen Modellen für über 80 Sprachen in lateinischer, kyrillischer, CJK-, Devanagari- und arabischer Schrift. Optionales IRIS iDRS-Modul für komplexe Layouts mit Unterstützung für 10 Sprachen, darunter Chinesisch, Japanisch und Koreanisch; schlankeres alternatives Modul für leistungsschwächere Hardware mit Unterstützung für 6 Sprachen.
Enterprise-Dokumenten-OCR (stabile Version 2.1): mehr als 200 Sprachen für gedruckte Texte, Korrektur von Schräglage und Drehung, Textextraktion aus nativen PDFs sowie Bewertung der Bildqualität. Premium-Erweiterungen (6 $ pro 1.000 Seiten) für Mathematik/LaTeX, Kontrollkästchenerkennung und Erkennung von Schriftstilen. Unterstützt mehr Sprachen als Apryse.
Handschrifterkennung (ICR)
Handschrift-ICR-Modul (veröffentlicht im April 2026): Erkennt handschriftlichen Text in PDFs und Bildern lokal, erstellt eine durchsuchbare Textebene und gibt JSON mit Seitenzahlen und Wortkoordinaten aus. Nur auf Englisch verfügbar.
Die Handschrifterkennung im OCR-Prozessor unterstützt gemäß der Sprachtabelle von Google etwa 50 Sprachen. Das Add-on für Schriftstile kennzeichnet einzelne Wörter als handschriftlich. Damit ist die Abdeckung handschriftlicher Inhalte deutlich größer als bei Apryse.
OCR-Ausgabe
Durchsuchbare PDF-Dateien oder JSON/XML mit einer hierarchischen Struktur aus Seiten, Absätzen, Zeilen und Wörtern einschließlich Koordinaten, Schriftgröße und Ausrichtung. Die OCR-Ausgabe enthält keine Konfidenzwerte für einzelne Wörter. Externe OCR-Daten im JSON-Format können wieder auf eine PDF-Datei angewendet werden.
Ein einheitliches Document JSON mit dem vollständigen Text sowie Blöcken, Absätzen, Zeilen und Tokens. Jedes Element enthält Textanker, normalisierte Begrenzungspolygone, einen eigenen Konfidenzwert, erkannte Sprachen und die Lesereihenfolge. Koordinaten mit dem Wert null werden in den Antworten nicht ausgegeben.
Layout und Dokumentstruktur
Die Document Structure Engine gibt Absätze, Überschriften (H1–H6), Listen, Inhaltsverzeichnisse, Tabellen und Bilder als JSON aus. Jedes Element enthält ein Begrenzungsrechteck und eine Seitenzahl. Dabei unterscheidet die Engine zwischen Spalten in Dokumentabschnitten und Tabellenspalten. Structured Output konvertiert PDFs zusätzlich in neu umbrochene DOCX-, XLSX-, PPTX- und HTML-Dateien.
Layout Parser gibt einen DocumentLayout-Baum mit Titeln, Überschriften, Absätzen, Tabellen, Listen, Kopf- und Fußzeilen sowie Abbildungen zurück. Zusätzlich liefert er kontextbezogene Abschnitte mit übergeordneten Überschriften für RAG. Unterstützt werden PDF, DOCX, PPTX, XLSX und HTML. Die stabile Version v1.0 arbeitet nicht generativ; Versionen mit Gemini 2.5 und Gemini 3 sind als Preview verfügbar. Begrenzungsrahmen für Abschnitte werden nur vom v1.0-Modell unterstützt. Seitenübergreifende Tabellen können aufgeteilt werden.
Tabellenextraktion
Die Tabular Data Engine verarbeitet verbundene Zellen und mehrzeilige Kopfzeilen. Sie gibt JSON-Daten für Tabellen, Zeilen und Zellen aus – einschließlich Zeilen- und Spaltenüberspannungen, Begrenzungsrahmen, Seitenzahlen sowie einer Gruppen-ID, die über mehrere Seiten fortgesetzte Tabellen verknüpft. Alternativ exportiert sie direkt in das XLSX-Format. Deep Learning Assist verbessert die Tabellenerkennung in der Document Structure Engine. Ein Konfidenzwert pro Zelle ist nicht verfügbar.
Form Parser extrahiert einfache Tabellen als Kopf- und Datenzeilen. Layout Parser gibt die Tabellenstruktur zurück. Seit Mai 2026 können Gemini-Versionen zudem die Inhalte von Tabellen und Abbildungen in Textform wiedergeben. Document AI Toolbox (Open-Source-Python) konvertiert Tabellen in Pandas, CSV, HTML oder Markdown.
Formulare und Schlüssel-Wert-Paare
Die Formularfelderkennung identifiziert Textfelder und Kontrollkästchen in gescannten oder statischen PDFs (Optionsfelder sind angekündigt) und kann ausfüllbare Felder in die PDF zurückschreiben. Form Field Key-Value ordnet Beschriftungen den zugehörigen Werten zu. Generic Key-Value Extraction funktioniert vorlagenfrei für verschiedene Dokumenttypen und gibt für jedes Schlüssel-Wert-Paar den Schlüssel, den Wert, Rechtecke auf Wortebene sowie einen Konfidenzwert von 0,0 bis 1,0 zurück. Darüber hinaus werden Metadaten aus CAD-Schriftfeldern in technischen Zeichnungen extrahiert.
Form Parser extrahiert Schlüssel-Wert-Paare, Kontrollkästchen, einfache Tabellen und 11 allgemeine Entitätstypen in über 200 Sprachen. Das Modell kann nicht trainiert werden. Laut Google werden Optionsfelder nicht zuverlässig erkannt, die Genauigkeit bei nicht lateinischen Schriftsystemen ist geringer und leere Formulare bereiten Probleme.
Benutzerdefinierte oder schemabasierte Extraktion
Nicht als Self-Service-Training verfügbar. Das SDK unterstützt weder benutzerdefinierte Schemas und Felder noch die Feinabstimmung von Modellen. Laut Dokumentation werden die JSON-Daten aus Smart Data Extraction zur Schema-Zuordnung an ein LLM Ihrer Wahl übergeben. Für benutzerdefinierte Vorlagenbereiche steht ein separates .NET-Produkt zur vorlagenbasierten Extraktion zur Verfügung.
Custom Extractor (allgemein verfügbar für Gemini 2.5 Flash und Pro; Versionen für Gemini 3 und 3.5 als Preview): Definieren Sie ein Schema und extrahieren Sie Daten anschließend per Zero-Shot, anhand von 5–10 gekennzeichneten Beispielen oder durch Fine-Tuning. Unterstützt verschachtelte und abgeleitete Entitäten, Signaturerkennung sowie Validierungsregeln. Englisch ist die offiziell unterstützte Sprache. Ein klarer Vorteil für Google.
Vortrainierte Dokumentenparser
Keine Einschränkungen nach Dokumenttyp. Die allgemeine Schlüssel-Wert-Extraktion und Klassifizierung funktioniert für Rechnungen, Belege, Ausweisdokumente, Formulare, Lebensläufe und weitere Kategorien, ohne dass für jeden Typ ein eigenes Modell erforderlich ist.
Parser für Rechnungen, Spesenbelege, Kontoauszüge, Gehaltsabrechnungen, W-2-Formulare, Identitätsnachweise und US-Führerscheine. Zahlreiche ältere Parser (für US-Reisepässe, die Steuerformulare 1099 und W-9 sowie für Kreditvergabe, Beschaffung und Versorgungsleistungen) wurden zum 30. Juni 2026 eingestellt.
Klassifizierung und Aufteilung
Klassifizierung auf Seitenebene in 24 vordefinierte Kategorien, darunter Rechnungen, Belege, Ausweise, Reisepässe, Formulare, Briefe, Rechtsdokumente, Finanzberichte und technische Zeichnungen. Für jede Kategorie werden ein Konfidenzwert von 0,0 bis 1,0 und ein konfigurierbarer Schwellenwert unterstützt. Benutzerdefinierte Bezeichnungen sind nicht möglich. Die Aufteilung erfolgt nicht durch ein Modell, sondern über die APIs des SDK zur Seitenbearbeitung.
Custom Classifier und Custom Splitter (allgemein verfügbar mit Gemini 2.5 Flash) mit benutzerdefinierten Labels, wahlweise als Zero-Shot-Modell oder anhand von etwa 10 Dokumenten pro Label trainiert. Kosten: 5 US-Dollar pro 1.000 Seiten. Der Splitter erkennt Seitengrenzen; die eigentliche Aufteilung erfolgt durch Ihren Code.
Koordinaten, Seitenverweise, Konfidenzwerte
Typisiertes JSON für jede Engine. Jedes Element enthält ein Rechteck und eine bei 1 beginnende Seitennummer. Formularfelder, Schlüssel-Wert-Paare und Klassifizierungsergebnisse enthalten Konfidenzwerte; Tabellen- und Strukturelemente enthalten Koordinaten, jedoch keine Konfidenzwerte.
Normalisierte Begrenzungspolygone und Seitenverweise für Tokens, Blöcke und Entitäten; Konfidenzwerte für Tokens und extrahierte Entitäten. Vergleichbare Koordinaten und Konfidenzwerte.
Eingabeformate
PDF-Dateien, ob digital erstellt oder gescannt, einschließlich passwortgeschützter Dateien. DOCX-Dateien, Bilder und mehr als 30 weitere Formate werden zunächst mit der integrierten Konvertierungsfunktion des SDK in PDF umgewandelt. OCR- und ICR-Module verarbeiten Bilder direkt.
PDF, TIFF, GIF, JPEG, PNG, BMP und WebP für OCR und die meisten Prozessoren; DOCX, PPTX, XLSX und HTML nur für Layout Parser. Google empfiehlt Scans mit 200–300 dpi. Custom Splitter unterstützt ausschließlich PDF, TIFF und GIF.
Seiten- und Größenbeschränkungen
Für die lizenzierte Nutzung ist keine Obergrenze pro Dokument angegeben; lange Dokumente werden vollständig verarbeitet. Testschlüssel sind auf 100 Seiten pro Extraktionsvorgang begrenzt. Dabei werden Seiten mit Wasserzeichen versehen.
15 Seiten pro synchroner Anfrage für OCR, Layout Parser, Form Parser, Custom Extractor, Classifier und Splitter (30 im imageless mode, fortlaufend ab Seite 1; 10 für Custom Extractor-Dokumente mit Kontrollkästchen). Online gilt ein Limit von 40 MB; pro Batch über Cloud Storage sind 1 GB und 5.000 Dateien zulässig, mit Obergrenzen von 500 Seiten (OCR, Layout), 200 Seiten (Custom Extractor, Classifier), 100 Seiten (Form Parser) und 1.000 Seiten (Splitter). Längere Dokumente müssen aufgeteilt, über Cloud Storage stapelweise verarbeitet und anschließend wieder zusammengesetzt werden.
Bereitstellung
In-Process-Bibliothek auf Ihren Servern: On-Premises, in der Private Cloud, in hybriden Umgebungen oder in isolierten Netzwerken (Air Gap). Docker, AWS Lambda, Azure Functions. Intelligente Datenextraktion unter Windows und Linux x64; OCR und ICR auch unter macOS.
Nur in Google-Cloud-Regionen verfügbar. Der volle Funktionsumfang steht in den Multiregionen USA und EU zur Verfügung; in Mumbai, Singapur, Sydney, London, Frankfurt und Montreal ist nur ein Teil der Prozessoren verfügbar. Document-AI-Prozessoren können weder On-Premises noch eingebettet bereitgestellt werden.
Preise
Paketlizenz: Smart Data Extraction ist eine Erweiterung für das Server SDK.
Enterprise Document OCR: 1,50 $ pro 1.000 Seiten (die ersten 1.000 Seiten sind kostenlos; ab 5 Mio. Seiten 0,60 $). Layout Parser: 10 $. Form Parser und Custom Extractor: 30 $ (ab 1 Mio. Seiten 20 $). Classifier und Splitter: 5 $ (ab 1 Mio. Seiten 3 $). OCR-Add-ons: 6 $. Vortrainierte Parser: zwischen 0,10 $ pro 10 Seiten und 0,75 $ pro Kontoauszug. Hinzu kommen 0,05 $ pro Stunde für jede bereitgestellte Version eines benutzerdefinierten Prozessors (etwa 438 $ pro Jahr) sowie Gebühren für reservierte Kapazitäten. Fehlgeschlagene Anfragen werden nicht berechnet.
Support und SLA
Wartung und Support von Montag bis Freitag (pazifische Zeitzone) mit garantierter Antwort innerhalb von zwei Werktagen; Konditionen für Enterprise-Tarife werden individuell vereinbart. Da die Software in Ihrer Umgebung ausgeführt wird, gilt keine SLA zur Verfügbarkeit.
Eine monatliche Verfügbarkeit von 99,9 % wird per SLA nur für die Online- und Batchverarbeitung über Endpunkte in mehreren Regionen zugesichert. Bereitstellungen in einer einzelnen Region, Vorschauversionen und der Best-Effort-Tarif sind vom SLA ausgenommen.
Mehr als nur Überschneidungen: die weiteren Funktionen des Apryse SDK
Google Document AI ist eine API zur Datenextraktion. Apryse ist ein Dokumenten-SDK, in dem die Datenextraktion eines von mehreren Modulen ist. Die folgenden Funktionen sind in derselben Apryse Lizenz und Codebasis enthalten, gehören jedoch nicht zu Document AI. Google deckt einige davon mit anderen Produkten wie Gemini, Workspace und Cloud Vision ab, jedoch nicht innerhalb von Document AI.
Anzeige und Rendering
WebViewer: Clientseitiges WebAssembly-Rendering von über 30 Formaten (PDF, Office, CAD, Bilder, E-Mails) mit einer quelloffenen React-UI. Dokumentinhalte verlassen zu keinem Zeitpunkt den Browser. Native Viewer für iOS und Android.
Nicht Bestandteil von Document AI.
Anmerkungen und Zusammenarbeit
Über 35 Anmerkungstypen, Zusammenarbeit mehrerer Benutzer in Echtzeit, Messwerkzeuge, Dokumentenvergleich und XFDF-Roundtrip.
Nicht Bestandteil von Document AI.
Formulare, Signaturen, Schwärzung
AcroForm- und XFA-Formulare, Erstellen und Ausfüllen von Formularen, elektronische und digitale Signaturen mit Zeitstempeln und Langzeitvalidierung, sichere Schwärzung mit Mustersuche, PDF-Bereinigung.
Nicht Bestandteil von Document AI. (Custom Extractor kann erkennen, ob eine Signatur vorhanden ist, führt jedoch keine Signatur aus.)
Konvertierung
Office in PDF ohne Microsoft Office, PDF in DOCX/XLSX/PPTX/HTML (strukturierte Ausgabe), HTML in PDF, CAD in PDF (DWG, DXF, DGN, DWF; RVT unter Windows als Beta-Version), E-Mails (EML, MSG) in PDF sowie DICOM- und HEIC-Bildformate.
Nicht Bestandteil von Document AI. Layout Parser liest Office-Dateien zur Datenextraktion ein, konvertiert oder rendert sie jedoch nicht.
Compliance-Formate
PDF/A-Konvertierung und -Validierung für alle Teile und Konformitätsstufen, PDF/UA mit automatischer Tag-Erstellung, Verschlüsselung und Berechtigungen sowie ein WCAG-2.2-AA-konformer Viewer.
Nicht Bestandteil von Document AI.
Erstellung, Scannen, elektronische Signatur
Flexible vorlagenbasierte Dokumentenerstellung, Scanbot SDK zum Scannen von Dokumenten und Barcodes auf Mobilgeräten, Xodo Sign für elektronische Signaturen sowie iText (ein Unternehmen von Apryse) für die PDF-Programmierung mit Java und .NET.
Nicht Bestandteil von Document AI.
Die praktische Konsequenz:
Ein Team, das ein Dokumentenprodukt auf Basis von Document AI entwickelt, benötigt weiterhin einen Viewer, einen Editor, einen Konverter und eine Oberfläche zur Dokumentenprüfung von anderen Anbietern. Mit Apryse erhalten Sie die Datenextraktion und die gesamte zugehörige Dokumententechnologie aus einer Hand – mit einer Engine und einer Lizenz.
Das sagen unsere Kunden

„Sie integrieren neue Funktionen schneller als die Konkurrenz, und ihre Produkt-Roadmap ist überzeugend – sie haben in die richtigen Bereiche investiert.“
Marcus O'Brien
Globaler Leiter des Produktmanagements, AutoCAD

„Die Integrität unserer Dokumente ist entscheidend. Apryse hat dieses Problem für uns vollständig gelöst.“
Uma Natarajan
CTO, Juume AI

„Die Rendering-Performance und die schnelle Unterstützung durch das Engineering-Team von Apryse haben die Qualität unseres Produkts spürbar verbessert.“
Amanda Lansman
Senior Product Manager, Dropbox
Wann Sie sich für Google Document AI entscheiden sollten
Ihre Dokumente befinden sich bereits in Google Cloud
Wenn Ihre übrige Pipeline auf BigQuery, Cloud Storage und Gemini Enterprise basiert, lässt sich Document AI mit einer IAM-Berechtigung und einem API-Aufruf anbinden. Die Ausgabe von Layout Parser fließt direkt in die RAG Engine von Google und die Dokumentenanalyse von BigQuery ein. Daten haben eine starke Bindung an ihre bestehende Umgebung – und es lohnt sich nur selten, dagegen anzukämpfen.
Schemabasierte Extraktion mit wenigen Beispielen
Mit Custom Extractor können Sie die gewünschten Felder definieren und ohne Beispiele oder nach dem Labeln von 5–10 Dokumenten extrahieren lassen – einschließlich verschachtelter Entitäten und Validierungsregeln. Apryse bietet keine vergleichbare Funktion. Sie müssten die strukturierte Ausgabe mit Ihrem eigenen LLM verarbeiten, um sie einem Schema zuzuordnen.
Umfassende Unterstützung für mehrere Sprachen und Handschriften
Ein Prozessor unterstützt über 200 gedruckte Sprachen und rund 50 Sprachen in Handschrift. Wenn Ihre Dokumente in anderen Sprachen als Englisch handschriftlich verfasst sind oder gedruckte Schriftsysteme verwenden, die nicht zu den über 80 vom OCR-Modul von Apryse unterstützten gehören, bietet Document AI die leistungsfähigere Texterkennung.
Vortrainierte Parser für Finanz- und Identitätsdokumente
Parser für Rechnungen, Ausgabenbelege, Kontoauszüge, Gehaltsabrechnungen, W2-Formulare und Identitätsdokumente liefern ohne vorherige Einrichtung typisierte Felder. Apryse extrahiert diese als allgemeine Schlüssel-Wert-Paare und Klassifizierungen statt anhand dokumentspezifischer Schemas.
Variabel oder geringes Volumen
Bei einem Preis von 1,50 $ pro 1.000 OCR-Seiten und 1.000 kostenlosen Seiten zum Einstieg entstehen für einen Prototyp oder einen Workflow mit geringem Volumen zunächst kaum Kosten. Die Abrechnung pro Seite lohnt sich, wenn das Volumen gering oder unvorhersehbar ist und eine Lizenz ansonsten ungenutzt bliebe.
Wann Sie sich für Apryse entscheiden sollten
Dokumente dürfen Ihre Umgebung nicht verlassen
Regulierte, souveräne oder vom Netz getrennte Umgebungen, in denen eine Cloud-API nicht infrage kommt. Intelligente Datenextraktion, OCR und ICR werden direkt auf Ihren Servern ausgeführt – auch in vollständig isolierten Air-Gap-Umgebungen. Dabei werden keine Daten an Apryse gesendet. Document AI kann weder On-Premises bereitgestellt noch eingebettet werden.
Sie liefern ein Produkt aus, statt eine Pipeline zu betreiben
Wenn die Extraktion eine Funktion Ihrer Software ist, benötigen Sie eine Komponente, die Sie in Ihr Produkt integrieren, versionieren und zusammen mit diesem lizenzieren können. Document AI ist ein Dienst, den Ihr Produkt aufruft; Apryse ist eine Bibliothek, die direkt in Ihr Produkt eingebunden ist.
Planbare Kosten bei hohem Volumen
Die Kosten einer Paketlizenz steigen nicht mit der Seitenzahl. Bei Document AI wird jede Seite abgerechnet (30 $ pro 1.000 Seiten für Form Parser oder Custom Extractor). Hinzu kommen Gebühren für Hosting und reservierte Kapazitäten, sodass die Kosten proportional zum Volumen steigen. Kalkulieren Sie Ihr jährliches Volumen und die Kombination der eingesetzten Prozessoren. Ab einem bestimmten Schwellenwert ist eine Lizenz günstiger und besser planbar.
Reproduzierbare, prüfbare Ergebnisse
Wenn dasselbe Dokument bei jedem Durchlauf dieselben Felder liefern muss – etwa für Audit-Trails, Regressionstests oder nachgelagerte Systeme, die keine Abweichungen tolerieren –, ist eine deterministische Analyse entscheidend. Die Gemini-basierten Prozessorversionen von Document AI sind generative Modelle.
Lange Dokumente ohne Aufteilung
Ein 300-seitiger Vertrag, Zeichnungssatz oder Schriftsatz wird vollständig verarbeitet. Keine synchrone Begrenzung auf 15 Seiten, keine Batch-Orchestrierung über Cloud Storage und kein nachträgliches Zusammenführen der Seitenzahlen.
Sie benötigen auch die übrigen Funktionen zur Dokumentenverarbeitung
Viewer, Anmerkungen, Formulare, Schwärzung, Signaturen, Bearbeitung, Konvertierung, Compliance und eine Benutzeroberfläche zur Prüfung, in der sich extrahierte Felder direkt auf der jeweiligen Seite des Quelldokuments einblenden lassen – alles aus demselben SDK wie die Datenextraktion. Document AI bietet keine dieser Funktionen.
Apryse ist die erste Wahl für Technologien zur Dokumentenverarbeitung

Unterstützt von einem Expertenteam
FAQ
Document AI ist eine Cloud-API: Sie senden Seiten an die Prozessoren von Google und zahlen pro Seite. Apryse ist ein SDK: Intelligente Datenextraktion, OCR und ICR werden direkt in Ihrer eigenen Anwendung und Infrastruktur ausgeführt und über eine Paketlizenz abgerechnet. Dasselbe SDK bietet außerdem Funktionen für Anzeige, Bearbeitung, Konvertierung und Compliance, die Document AI nicht abdeckt.
Nein. Document AI-Prozessoren werden ausschließlich in Google-Cloud-Regionen ausgeführt. Für Umgebungen ohne Internetverbindung bietet Google lediglich eine einfache OCR-Funktion in Google Distributed Cloud an. Layout Parser, Form Parser und benutzerdefinierte Extraktoren sind darin nicht enthalten. Apryse kann On-Premises, in einer Private Cloud oder vollständig vom Netzwerk isoliert betrieben werden.
Nein. Intelligente Datenextraktion benötigt keine Vorlagen und ist sofort einsatzbereit. Sie unterstützt die allgemeine Schlüssel-Wert-Extraktion, Tabellenextraktion und Formularfelderkennung sowie die Klassifizierung in 24 vordefinierte Kategorien. Ein eigenständiges Training oder die Definition benutzerdefinierter Schemas ist nicht vorgesehen. Teams, die ein bestimmtes Schema benötigen, können die strukturierten JSON-Daten an ein LLM ihrer Wahl übergeben.
Document AI begrenzt synchrone Anfragen auf 15 Seiten (30 im Modus ohne Bilder) und Batch-Anfragen je nach Prozessor auf 100 bis 1.000 Seiten. Längere Dokumente werden aufgeteilt, über Cloud Storage verarbeitet und anschließend wieder zusammengesetzt. Für die lizenzierte Nutzung von Apryse ist keine Begrenzung pro Dokument dokumentiert. Die Verarbeitung erfolgt lokal und ist nur durch Ihre Hardware beschränkt.
Ja. Document AI gibt normalisierte Begrenzungspolygone sowie Konfidenzwerte für Tokens und Entitäten zurück. Apryse liefert für jedes extrahierte Element ein Rechteck und die Seitenzahl sowie Konfidenzwerte für Formularfelder, Schlüssel-Wert-Paare und Klassifizierungsergebnisse. Der Unterschied: Apryse rekonstruiert die Struktur deterministisch. Dadurch liefert dasselbe Dokument bei jeder Verarbeitung dasselbe Ergebnis, während die Gemini-basierten Prozessorversionen von Document AI generativ arbeiten.
Bei geringem oder schwankendem Volumen ja. OCR kostet 1,50 $ pro 1.000 Seiten, wobei die ersten 1.000 Seiten kostenlos sind. Eine Lizenz muss nicht erworben werden. Bei hohem Volumen sieht die Rechnung anders aus: Form Parser und Custom Extractor kosten 30 $ pro 1.000 Seiten, bereitgestellte benutzerdefinierte Prozessoren jeweils 0,05 $ pro Stunde und reservierte Kapazität 300 $ pro Seite pro Minute und Monat. Apryse wird als Paket lizenziert; die Kosten richten sich nicht nach der Seitenzahl. Kalkulieren Sie daher vor Ihrer Entscheidung Ihr jährliches Seitenvolumen.
Derzeit bietet keiner der beiden Anbieter eine API zur Zusammenfassung an: Googles nur als Vorschau verfügbarer Summarizer wurde am 30. Juni 2026 eingestellt; für Zusammenfassungen wird nun auf die Gemini API verwiesen. Die strukturierten Ausgaben von Apryse können mit einem Modell Ihrer Wahl zusammengefasst werden. Googles Human-in-the-Loop-Prüfdienst wurde im Januar 2025 eingestellt; als Ersatz wurden Partnerlösungen empfohlen. Apryse liefert WebViewer im selben SDK mit, sodass sich eine Prüfoberfläche direkt in das Produkt integrieren lässt.
Ja. Diese Funktionen machen den größeren Teil des SDK aus. Die Anzeige und Kommentierung von mehr als 30 Formaten, Formulare, Schwärzung, digitale Signaturen, die Bearbeitung von PDF- und DOCX-Dateien im Browser, die Konvertierung zwischen PDF, Office, HTML, CAD und E-Mail, die Einhaltung von PDF/A und PDF/UA, die Dokumentenerstellung mit Fluent sowie mobiles Scannen mit Scanbot SDK sind alle in derselben Apryse-Lizenz enthalten. Document AI ist auf OCR, Layoutanalyse, Datenextraktion, Klassifizierung und Dokumentaufteilung beschränkt.


