FlowParse
Funktion September 2026 14 Min. Lesezeit

E-Rechnung Format-Erkennung

Bevor eine Rechnung gelesen werden kann, muss zuerst feststehen, in welcher Form sie überhaupt vorliegt. Diese Funktion erkennt automatisch, ob eine Datei eine reine XRechnung-XML, ein hybrides ZUGFeRD-Dokument oder ein klassisches PDF ist — und wählt entsprechend den richtigen Leseweg.

FlowParse
flowparse.io
flowparse.ioTon ist nicht nötig
0:00 / 0:00

Der erste Schritt, bevor überhaupt gelesen wird

Wer täglich Eingangsrechnungen bearbeitet, hat sich diese Frage seit der E-Rechnungspflicht schon oft gestellt: Ist das jetzt eine echte XRechnung, ein ZUGFeRD-Dokument oder einfach nur ein PDF? Die Antwort lässt sich oft nicht auf den ersten Blick erkennen — eine Datei mit der Endung .pdf kann genauso gut ein hybrides ZUGFeRD-Dokument mit eingebetteter Struktur sein wie ein ganz gewöhnliches, unstrukturiertes Dokument.

Genau diese Unsicherheit beseitigt die Format-Erkennung, bevor überhaupt der eigentliche Lesevorgang beginnt. Sie prüft jede hochgeladene Datei auf ihre tatsächliche innere Struktur und stellt fest, welches der drei relevanten Formate vorliegt — unabhängig davon, was der Dateiname oder die Endung vermuten lassen.

FlowParse
flowparse.io

Warum Erkennung ein eigener Schritt ist

Man könnte annehmen, das Format sei mit der Dateiendung bereits klar — in der Praxis stimmt das seit der E-Rechnungspflicht nicht mehr. Ein ZUGFeRD-Dokument trägt äußerlich die Endung .pdf, obwohl es eine vollständige, maschinenlesbare XML-Struktur enthält. Eine XRechnung trägt zwar meist die Endung .xml, lässt sich aber ohne Software überhaupt nicht sinnvoll ansehen. Und ein klassisches PDF sieht auf den ersten Blick oft identisch aus wie ein ZUGFeRD-Dokument, enthält aber keinerlei eingebettete Struktur.

Ohne einen eigenen Erkennungsschritt müsste jede Datei nach dem ungünstigsten anzunehmenden Format behandelt werden — was entweder strukturierte Daten übersieht, die eigentlich vorhanden wären, oder unnötig Aufwand für eine visuelle Extraktion betreibt, obwohl längst strukturierte Felder verfügbar sind. Die Erkennung sorgt dafür, dass jede Datei genau den Leseweg bekommt, der zu ihrem tatsächlichen Inhalt passt.

Was das nicht ersetzt

Keine formale EN-16931-Validierung

Die Erkennung stellt fest, welches Format vorliegt — ob die Datei jede Detailanforderung des Standards technisch korrekt erfüllt, prüft ein dedizierter Validator wie der der KoSIT.

Kein Ersatz für eine E-Rechnungs-fähige Buchhaltungssoftware

Die Erkennung liest und ordnet eingehende Dateien ein; das Erstellen und Versenden eigener E-Rechnungen bleibt Aufgabe Ihrer Rechnungssoftware.

Keine rechtliche Einordnung

Ob eine konkrete Rechnung den Anforderungen des §14 UStG genügt, ist eine Frage für Ihre Steuerberatung, unabhängig vom technisch erkannten Format.

Woran ein Format erkannt wird

FormatErkennungsmerkmal
XRechnungReine XML-Struktur nach UBL oder CII, kein eingebettetes PDF-Layout
ZUGFeRDPDF/A-3-Container mit eingebetteter XML-Datei im Anhang
Klassisches PDFKeine eingebettete XML, reines visuelles Seitenlayout

Die Prüfung schaut also nicht auf den Dateinamen, sondern auf die tatsächliche innere Struktur der Datei selbst — den zuverlässigsten Indikator, den es für das tatsächliche Format gibt.

FlowParse
flowparse.io

Die Reihenfolge der Prüfung

1

Containerstruktur prüfen

Zunächst wird geprüft, ob überhaupt eine eingebettete XML-Datei innerhalb eines PDF-Containers vorhanden ist.

2

Reine XML-Datei prüfen

Liegt keine PDF-Hülle vor, wird geprüft, ob die Datei selbst eine gültige XRechnung-Struktur nach UBL oder CII ist.

3

Visuelles Layout als letzter Weg

Wird weder eine eingebettete noch eine eigenständige XML-Struktur gefunden, greift die visuelle Extraktion für klassische PDF-Rechnungen.

4

Profil und Detailgrad bestimmen

Innerhalb eines erkannten ZUGFeRD-Dokuments wird zusätzlich das konkrete Profil ermittelt.

5

Ergebnis dokumentieren

Das erkannte Format wird als eigenes Feld in der Ausgabetabelle festgehalten.

FlowParse
flowparse.io

ZUGFeRD-Profile innerhalb der Erkennung

Ist ein Dokument als ZUGFeRD erkannt, endet die Prüfung nicht dort — innerhalb des hybriden Formats gibt es mehrere Profile mit unterschiedlichem Detailgrad, von MINIMUM mit nur wenigen Kernfeldern bis zu EXTENDED mit vollständigen Positionsdaten für komplexere Geschäftsfälle. Welches Profil konkret vorliegt, wird als Teil der Erkennung mitbestimmt, da es direkt beeinflusst, wie viele Felder mit hoher Sicherheit gelesen werden können.

Ein Lieferant, der durchgehend im COMFORT-Profil liefert, liefert praktisch immer vollständigere Daten als einer, der nur das minimale Profil verwendet — ein Unterschied, der für die Buchhaltungspraxis durchaus relevant ist, etwa bei der Frage, wie viel manuelle Nachkontrolle für einen bestimmten Lieferanten realistisch eingeplant werden sollte.

FlowParse
flowparse.io

Grenzfälle, die häufig vorkommen

In der Praxis ist nicht jede Datei ein Lehrbuchbeispiel. Manche Rechnungssoftware erzeugt ein ZUGFeRD-Dokument, dessen eingebettete XML unvollständig oder leicht fehlerhaft strukturiert ist — eine erkennbare, aber nicht vollständig valide Instanz des Formats. Andere Systeme liefern eine XRechnung, die zwar der Grundstruktur folgt, aber einzelne optionale Felder auslässt, die in der Praxis dennoch erwartet werden.

Für solche Grenzfälle gilt derselbe Grundsatz wie überall in der Extraktion: Das Format wird nach bestem Ergebnis erkannt, unklare oder unvollständige Bereiche werden markiert statt stillschweigend übergangen — eine ehrliche, nachvollziehbare Einordnung ist in der Buchhaltungspraxis wertvoller als eine scheinbar perfekte, aber falsche Zuordnung.

Drei Dateien, ein Vorgang

Drei Dateien aus demselben Monatsposteingang werden gleichzeitig hochgeladen — eine trägt die Endung .xml, eine .pdf von einem großen Softwarepartner, eine .pdf von einem kleineren Handwerksbetrieb.

DateiErkanntes Format
rechnung_4471.xmlXRechnung (UBL)
softwarepartner_re.pdfZUGFeRD, Profil COMFORT
handwerk_juli.pdfKlassisches PDF, ohne eingebettete Struktur

Alle drei Dateien landen am Ende in derselben Ausgabetabelle, jede mit ihrem erkannten Format als eigenem Feld dokumentiert — sichtbar, nachvollziehbar, ohne dass jemand die Dateien einzeln von Hand hätte einordnen müssen.

FlowParse
flowparse.io

Wie zuverlässig die Erkennung ist

Da die Prüfung auf der tatsächlichen Dateistruktur basiert und nicht auf Namenskonventionen oder Metadaten, ist die Erkennung des grundlegenden Formats — XRechnung, ZUGFeRD oder klassisches PDF — in der Praxis äußerst zuverlässig, auch bei ungewöhnlich benannten oder umbenannten Dateien. Schwieriger wird es bei der feineren Einordnung, etwa dem genauen ZUGFeRD-Profil bei einer unvollständig strukturierten Datei — hier greift dieselbe Markierungslogik wie bei jedem unsicheren Feld während der eigentlichen Extraktion.

Manuell vs. automatisch erkannt

ManuellAutomatisch
Format anhand der Dateiendung geratenFormat anhand der tatsächlichen Struktur bestimmt
ZUGFeRD manuell in einem Viewer geöffnetProfil automatisch erkannt
Jede Datei einzeln geprüftGanzer Stapel in einem Durchgang eingeordnet
Format nirgendwo dokumentiertFormat als eigenes Feld im Export festgehalten

Erkennung im Stapel

Bei einem einzelnen Dokument mag der Unterschied zwischen manuellem und automatischem Erkennen gering erscheinen. Bei einem ganzen Monat voller Eingangsrechnungen aus dutzenden Quellen mit unterschiedlichem Digitalisierungsgrad wird der Unterschied schnell erheblich — jede Datei müsste sonst einzeln geöffnet und bewertet werden, bevor überhaupt an das eigentliche Lesen zu denken wäre.

Die automatische Erkennung skaliert dagegen ohne zusätzlichen Aufwand: Ob ein oder hundert Dateien hochgeladen werden, jede einzelne wird nach demselben Verfahren eingeordnet, bevor der eigentliche Extraktionsschritt beginnt.

FlowParse
flowparse.io

Beschädigte oder unvollständige Dateien

Nicht jede Datei, die im Posteingang landet, ist technisch einwandfrei — ein unvollständiger Export aus einer älteren Softwareversion, eine beschädigte XML-Struktur oder ein PDF, dessen eingebetteter XML-Anhang beim Versand verloren gegangen ist, kommen in der Praxis vor. Die Erkennung behandelt solche Fälle nicht als harten Fehler, sondern ordnet die Datei nach dem bestmöglich erkennbaren Format ein und markiert die Unsicherheit entsprechend, statt den gesamten Vorgang abzubrechen.

Wer diese Funktion nutzt

Buchhalter in KMU

Ein einheitlicher erster Schritt für jede eingehende Rechnung, unabhängig vom Lieferanten.

Steuerberater und Kanzleien

Mandanten mit unterschiedlichem Digitalisierungsgrad ohne Sonderbehandlung pro Format bedient.

IT-Verantwortliche während der Umstellung

Ein klarer Überblick, welche Lieferanten bereits strukturiert liefern.

Controller und Finanzteams

Verlässliche, dokumentierte Formatangaben für spätere Auswertungen.

Wie die Erkennung mit dem Lesen zusammenspielt

Für den Nutzer laufen Erkennung und Extraktion als ein einziger, ununterbrochener Vorgang ab — eine Datei wird hochgeladen, und wenige Sekunden später liegt eine strukturierte Tabellenzeile vor, mit dem erkannten Format als einem von mehreren gelesenen Feldern. Die eigentliche Detailseite zum Umwandeln von XRechnung und ZUGFeRD in Excel beschreibt, wie der anschließende Lesevorgang für jedes erkannte Format im Einzelnen funktioniert.

Häufige Fehler ohne automatische Erkennung

Ein ZUGFeRD-Dokument wird wie ein klassisches PDF behandelt

Die eingebettete, maschinenlesbare Struktur bleibt ungenutzt, obwohl sie eine deutlich zuverlässigere Datenquelle wäre als eine rein visuelle Extraktion.

Eine XRechnung wird versehentlich für ungültig gehalten

Weil sich die Datei ohne Software nicht öffnen lässt, wird sie fälschlich als beschädigt eingestuft, obwohl sie technisch vollkommen in Ordnung ist.

Das Profil eines ZUGFeRD-Dokuments wird ignoriert

Ein MINIMUM-Profil wird mit denselben Erwartungen behandelt wie ein COMFORT-Profil, was zu unnötiger Verwirrung über vermeintlich fehlende Felder führt.

Was die fehlende Erkennung kostet

Ohne eine verlässliche Formaterkennung entstehen in der Praxis zwei Arten von Kosten, die sich selten in einer Kalkulation wiederfinden, aber real sind. Die erste ist offensichtlich: Zeit, die für das manuelle Öffnen, Zuordnen und Prüfen jeder einzelnen Datei aufgewendet wird, obwohl ein automatischer Schritt dieselbe Zuordnung in Sekunden treffen könnte. Bei einem überschaubaren monatlichen Volumen mag das kaum ins Gewicht fallen — bei mehreren hundert Eingangsrechnungen summiert sich dieser Aufwand schnell zu mehreren Arbeitsstunden im Monat.

Die zweite, subtilere Kostenart entsteht dort, wo eine Datei falsch eingeordnet wird — etwa ein ZUGFeRD-Dokument, das versehentlich wie ein einfaches PDF behandelt wird, wodurch die eingebettete, bereits strukturierte Information ungenutzt bleibt und stattdessen erneut mühsam aus dem visuellen Layout extrahiert werden muss. Diese Art von Fehler fällt selten sofort auf, führt aber über die Zeit zu einer spürbar geringeren Datenqualität, als eigentlich möglich wäre.

FlowParse
flowparse.io

Eine nachvollziehbare Prüfspur

Ein oft übersehener Nebeneffekt der automatischen Formaterkennung ist die Dokumentation, die dabei entsteht. Da jedes erkannte Format als eigenes Feld im Export festgehalten wird, lässt sich im Nachhinein für jede einzelne Rechnung nachvollziehen, wie sie ursprünglich vorlag und wie sie verarbeitet wurde — eine Prüfspur, die bei einer internen Kontrolle oder einer Rückfrage der Steuerberatung wertvoll sein kann, ohne dass dafür ein eigenes Protokoll geführt werden müsste.

Für ein Unternehmen, das seine eigene Umstellung auf E-Rechnungen dokumentieren möchte — etwa um gegenüber der Geschäftsführung oder einem Prüfer den Digitalisierungsfortschritt zu belegen — ist diese automatisch mitgeführte Information ein praktischer Nebennutzen, der ohne zusätzlichen Aufwand entsteht.

Ein genauerer Blick auf die technische Prüfung

Wer wissen möchte, was hinter der Erkennung technisch tatsächlich passiert, findet die Antwort in der Struktur einer PDF-Datei selbst. Ein PDF nach dem Standard PDF/A-3, der auch für ZUGFeRD verwendet wird, erlaubt es, beliebige Dateien als Anhang direkt im Dokument einzubetten — ähnlich wie ein Anhang in einer E-Mail, nur dauerhaft mit dem PDF selbst verbunden. Die Erkennung öffnet das PDF, prüft, ob ein solcher eingebetteter Anhang mit dem erwarteten XML-Namen vorhanden ist, und liest bei einem Treffer dessen Inhalt direkt aus — ganz ohne den Umweg über eine visuelle Texterkennung, die für ein reines PDF sonst notwendig wäre.

Fehlt ein solcher eingebetteter Anhang, prüft die Erkennung im nächsten Schritt, ob die Datei selbst überhaupt eine PDF-Struktur besitzt. Ist das nicht der Fall, handelt es sich vermutlich um eine reine XML-Datei — die Erkennung prüft dann, ob diese XML einem der beiden für XRechnung zulässigen Syntaxen folgt, UBL (Universal Business Language) oder CII (Cross Industry Invoice), beides internationale Standards, auf denen auch der europäische Rahmenstandard EN 16931 aufbaut. Erst wenn auch diese Prüfung kein eindeutiges Ergebnis liefert, greift die visuelle Extraktion als letzter, verlässlicher Rückfallweg.

Dieser mehrstufige Aufbau ist bewusst so gewählt, dass er robust gegenüber Abweichungen einzelner Softwarehersteller bleibt — nicht jede Implementierung folgt jedem Detail der Spezifikation exakt, und eine Erkennung, die nur nach einem einzigen, starren Muster sucht, würde bei kleineren Abweichungen schnell versagen. Die schichtweise Prüfung von der spezifischsten zur allgemeinsten Möglichkeit sorgt dafür, dass auch untypische, aber im Kern korrekte Dateien zuverlässig erkannt werden.

FlowParse
flowparse.io

Wie sich die Formatverteilung typischerweise entwickelt

Über die bisherige Beobachtung mehrerer Unternehmen mit unterschiedlichem Lieferantenstamm zeichnet sich ein wiederkehrendes Muster ab: Direkt nach dem Stichtag für die Empfangspflicht verändert sich die tatsächliche Formatverteilung im Posteingang zunächst kaum, da die meisten Lieferanten ihre eigene Versandpflicht noch gar nicht erreicht haben. Erst mit fortschreitender Zeit, wenn immer mehr Lieferanten ihre eigenen gestaffelten Fristen erreichen, steigt der Anteil strukturierter Formate spürbar an — ein Prozess, der sich eher über Jahre als über Monate vollzieht.

Für die eigene Planung bedeutet das: Ein formatunabhängiger Prozess, der heute eingerichtet wird, bleibt über die gesamte Dauer dieser allmählichen Verschiebung relevant, ohne dass er zwischenzeitlich angepasst werden müsste. Die automatische Erkennung passt sich der sich wandelnden Formatverteilung von selbst an, ohne dass jemand manuell nachjustieren müsste, sobald sich das Verhältnis zwischen PDF, ZUGFeRD und XRechnung im eigenen Posteingang verschiebt.

Wer diese Entwicklung über einen längeren Zeitraum verfolgt, gewinnt nebenbei einen praktischen Indikator dafür, wie weit die eigene Lieferantenbasis in ihrer Digitalisierung insgesamt fortgeschritten ist — eine Information, die sich sonst kaum systematisch erfassen ließe, hier aber als Nebenprodukt der ohnehin stattfindenden täglichen Verarbeitung anfällt.

Ein Vergleich über mehrere Quartale hinweg zeigt dabei oft deutlicher als jede einzelne Momentaufnahme, wie sich der eigene Lieferantenstamm insgesamt entwickelt — ein Anteil strukturierter Formate, der spürbar steigt, deutet auf eine aktive, insgesamt fortschreitende Digitalisierung der eigenen Geschäftsbeziehungen hin, während ein über längere Zeit stabiler Anteil eher auf einen festen Kern langjähriger, technisch weniger dynamischer Lieferanten hindeutet.

Jetzt eine Datei testen

Laden Sie eine echte XRechnung, ein ZUGFeRD-Dokument oder ein klassisches PDF hoch, um zu sehen, welches Format erkannt wird — ohne Registrierung.

Datenschutz

Der Upload erfolgt über TLS, durchgehend verschlüsselt.

Die Verarbeitung läuft auf Infrastruktur in der EU.

Originaldokumente werden unmittelbar nach der Verarbeitung gelöscht.

Rechnungsdaten werden nie zum Training von KI-Modellen verwendet.

Details zu Verschlüsselung und Löschfristen stehen auf der Seite zur Sicherheit.

Häufige Fragen

Testen Sie die Formaterkennung

Laden Sie eine echte Rechnung hoch — ohne Registrierung — und sehen Sie sofort, welches Format erkannt wird.

Weiterlesen