Der erste Schritt, bevor überhaupt gelesen wird
Wer täglich Eingangsrechnungen bearbeitet, hat sich diese Frage seit der E-Rechnungspflicht schon oft gestellt: Ist das jetzt eine echte XRechnung, ein ZUGFeRD-Dokument oder einfach nur ein PDF? Die Antwort lässt sich oft nicht auf den ersten Blick erkennen — eine Datei mit der Endung .pdf kann genauso gut ein hybrides ZUGFeRD-Dokument mit eingebetteter Struktur sein wie ein ganz gewöhnliches, unstrukturiertes Dokument.
Genau diese Unsicherheit beseitigt die Format-Erkennung, bevor überhaupt der eigentliche Lesevorgang beginnt. Sie prüft jede hochgeladene Datei auf ihre tatsächliche innere Struktur und stellt fest, welches der drei relevanten Formate vorliegt — unabhängig davon, was der Dateiname oder die Endung vermuten lassen.
Warum Erkennung ein eigener Schritt ist
Man könnte annehmen, das Format sei mit der Dateiendung bereits klar — in der Praxis stimmt das seit der E-Rechnungspflicht nicht mehr. Ein ZUGFeRD-Dokument trägt äußerlich die Endung .pdf, obwohl es eine vollständige, maschinenlesbare XML-Struktur enthält. Eine XRechnung trägt zwar meist die Endung .xml, lässt sich aber ohne Software überhaupt nicht sinnvoll ansehen. Und ein klassisches PDF sieht auf den ersten Blick oft identisch aus wie ein ZUGFeRD-Dokument, enthält aber keinerlei eingebettete Struktur.
Ohne einen eigenen Erkennungsschritt müsste jede Datei nach dem ungünstigsten anzunehmenden Format behandelt werden — was entweder strukturierte Daten übersieht, die eigentlich vorhanden wären, oder unnötig Aufwand für eine visuelle Extraktion betreibt, obwohl längst strukturierte Felder verfügbar sind. Die Erkennung sorgt dafür, dass jede Datei genau den Leseweg bekommt, der zu ihrem tatsächlichen Inhalt passt.
Was das nicht ersetzt
Keine formale EN-16931-Validierung
Die Erkennung stellt fest, welches Format vorliegt — ob die Datei jede Detailanforderung des Standards technisch korrekt erfüllt, prüft ein dedizierter Validator wie der der KoSIT.
Kein Ersatz für eine E-Rechnungs-fähige Buchhaltungssoftware
Die Erkennung liest und ordnet eingehende Dateien ein; das Erstellen und Versenden eigener E-Rechnungen bleibt Aufgabe Ihrer Rechnungssoftware.
Keine rechtliche Einordnung
Ob eine konkrete Rechnung den Anforderungen des §14 UStG genügt, ist eine Frage für Ihre Steuerberatung, unabhängig vom technisch erkannten Format.
Woran ein Format erkannt wird
| Format | Erkennungsmerkmal |
|---|---|
| XRechnung | Reine XML-Struktur nach UBL oder CII, kein eingebettetes PDF-Layout |
| ZUGFeRD | PDF/A-3-Container mit eingebetteter XML-Datei im Anhang |
| Klassisches PDF | Keine eingebettete XML, reines visuelles Seitenlayout |
Die Prüfung schaut also nicht auf den Dateinamen, sondern auf die tatsächliche innere Struktur der Datei selbst — den zuverlässigsten Indikator, den es für das tatsächliche Format gibt.
Die Reihenfolge der Prüfung
Containerstruktur prüfen
Zunächst wird geprüft, ob überhaupt eine eingebettete XML-Datei innerhalb eines PDF-Containers vorhanden ist.
Reine XML-Datei prüfen
Liegt keine PDF-Hülle vor, wird geprüft, ob die Datei selbst eine gültige XRechnung-Struktur nach UBL oder CII ist.
Visuelles Layout als letzter Weg
Wird weder eine eingebettete noch eine eigenständige XML-Struktur gefunden, greift die visuelle Extraktion für klassische PDF-Rechnungen.
Profil und Detailgrad bestimmen
Innerhalb eines erkannten ZUGFeRD-Dokuments wird zusätzlich das konkrete Profil ermittelt.
Ergebnis dokumentieren
Das erkannte Format wird als eigenes Feld in der Ausgabetabelle festgehalten.
ZUGFeRD-Profile innerhalb der Erkennung
Ist ein Dokument als ZUGFeRD erkannt, endet die Prüfung nicht dort — innerhalb des hybriden Formats gibt es mehrere Profile mit unterschiedlichem Detailgrad, von MINIMUM mit nur wenigen Kernfeldern bis zu EXTENDED mit vollständigen Positionsdaten für komplexere Geschäftsfälle. Welches Profil konkret vorliegt, wird als Teil der Erkennung mitbestimmt, da es direkt beeinflusst, wie viele Felder mit hoher Sicherheit gelesen werden können.
Ein Lieferant, der durchgehend im COMFORT-Profil liefert, liefert praktisch immer vollständigere Daten als einer, der nur das minimale Profil verwendet — ein Unterschied, der für die Buchhaltungspraxis durchaus relevant ist, etwa bei der Frage, wie viel manuelle Nachkontrolle für einen bestimmten Lieferanten realistisch eingeplant werden sollte.
Grenzfälle, die häufig vorkommen
In der Praxis ist nicht jede Datei ein Lehrbuchbeispiel. Manche Rechnungssoftware erzeugt ein ZUGFeRD-Dokument, dessen eingebettete XML unvollständig oder leicht fehlerhaft strukturiert ist — eine erkennbare, aber nicht vollständig valide Instanz des Formats. Andere Systeme liefern eine XRechnung, die zwar der Grundstruktur folgt, aber einzelne optionale Felder auslässt, die in der Praxis dennoch erwartet werden.
Für solche Grenzfälle gilt derselbe Grundsatz wie überall in der Extraktion: Das Format wird nach bestem Ergebnis erkannt, unklare oder unvollständige Bereiche werden markiert statt stillschweigend übergangen — eine ehrliche, nachvollziehbare Einordnung ist in der Buchhaltungspraxis wertvoller als eine scheinbar perfekte, aber falsche Zuordnung.
Drei Dateien, ein Vorgang
Drei Dateien aus demselben Monatsposteingang werden gleichzeitig hochgeladen — eine trägt die Endung .xml, eine .pdf von einem großen Softwarepartner, eine .pdf von einem kleineren Handwerksbetrieb.
| Datei | Erkanntes Format |
|---|---|
| rechnung_4471.xml | XRechnung (UBL) |
| softwarepartner_re.pdf | ZUGFeRD, Profil COMFORT |
| handwerk_juli.pdf | Klassisches PDF, ohne eingebettete Struktur |
Alle drei Dateien landen am Ende in derselben Ausgabetabelle, jede mit ihrem erkannten Format als eigenem Feld dokumentiert — sichtbar, nachvollziehbar, ohne dass jemand die Dateien einzeln von Hand hätte einordnen müssen.
Wie zuverlässig die Erkennung ist
Da die Prüfung auf der tatsächlichen Dateistruktur basiert und nicht auf Namenskonventionen oder Metadaten, ist die Erkennung des grundlegenden Formats — XRechnung, ZUGFeRD oder klassisches PDF — in der Praxis äußerst zuverlässig, auch bei ungewöhnlich benannten oder umbenannten Dateien. Schwieriger wird es bei der feineren Einordnung, etwa dem genauen ZUGFeRD-Profil bei einer unvollständig strukturierten Datei — hier greift dieselbe Markierungslogik wie bei jedem unsicheren Feld während der eigentlichen Extraktion.
Manuell vs. automatisch erkannt
| Manuell | Automatisch |
|---|---|
| Format anhand der Dateiendung geraten | Format anhand der tatsächlichen Struktur bestimmt |
| ZUGFeRD manuell in einem Viewer geöffnet | Profil automatisch erkannt |
| Jede Datei einzeln geprüft | Ganzer Stapel in einem Durchgang eingeordnet |
| Format nirgendwo dokumentiert | Format als eigenes Feld im Export festgehalten |
Erkennung im Stapel
Bei einem einzelnen Dokument mag der Unterschied zwischen manuellem und automatischem Erkennen gering erscheinen. Bei einem ganzen Monat voller Eingangsrechnungen aus dutzenden Quellen mit unterschiedlichem Digitalisierungsgrad wird der Unterschied schnell erheblich — jede Datei müsste sonst einzeln geöffnet und bewertet werden, bevor überhaupt an das eigentliche Lesen zu denken wäre.
Die automatische Erkennung skaliert dagegen ohne zusätzlichen Aufwand: Ob ein oder hundert Dateien hochgeladen werden, jede einzelne wird nach demselben Verfahren eingeordnet, bevor der eigentliche Extraktionsschritt beginnt.
Beschädigte oder unvollständige Dateien
Nicht jede Datei, die im Posteingang landet, ist technisch einwandfrei — ein unvollständiger Export aus einer älteren Softwareversion, eine beschädigte XML-Struktur oder ein PDF, dessen eingebetteter XML-Anhang beim Versand verloren gegangen ist, kommen in der Praxis vor. Die Erkennung behandelt solche Fälle nicht als harten Fehler, sondern ordnet die Datei nach dem bestmöglich erkennbaren Format ein und markiert die Unsicherheit entsprechend, statt den gesamten Vorgang abzubrechen.
Wer diese Funktion nutzt
Buchhalter in KMU
Ein einheitlicher erster Schritt für jede eingehende Rechnung, unabhängig vom Lieferanten.
Steuerberater und Kanzleien
Mandanten mit unterschiedlichem Digitalisierungsgrad ohne Sonderbehandlung pro Format bedient.
IT-Verantwortliche während der Umstellung
Ein klarer Überblick, welche Lieferanten bereits strukturiert liefern.
Controller und Finanzteams
Verlässliche, dokumentierte Formatangaben für spätere Auswertungen.
Wie die Erkennung mit dem Lesen zusammenspielt
Für den Nutzer laufen Erkennung und Extraktion als ein einziger, ununterbrochener Vorgang ab — eine Datei wird hochgeladen, und wenige Sekunden später liegt eine strukturierte Tabellenzeile vor, mit dem erkannten Format als einem von mehreren gelesenen Feldern. Die eigentliche Detailseite zum Umwandeln von XRechnung und ZUGFeRD in Excel beschreibt, wie der anschließende Lesevorgang für jedes erkannte Format im Einzelnen funktioniert.
Häufige Fehler ohne automatische Erkennung
Ein ZUGFeRD-Dokument wird wie ein klassisches PDF behandelt
Die eingebettete, maschinenlesbare Struktur bleibt ungenutzt, obwohl sie eine deutlich zuverlässigere Datenquelle wäre als eine rein visuelle Extraktion.
Eine XRechnung wird versehentlich für ungültig gehalten
Weil sich die Datei ohne Software nicht öffnen lässt, wird sie fälschlich als beschädigt eingestuft, obwohl sie technisch vollkommen in Ordnung ist.
Das Profil eines ZUGFeRD-Dokuments wird ignoriert
Ein MINIMUM-Profil wird mit denselben Erwartungen behandelt wie ein COMFORT-Profil, was zu unnötiger Verwirrung über vermeintlich fehlende Felder führt.
Was die fehlende Erkennung kostet
Ohne eine verlässliche Formaterkennung entstehen in der Praxis zwei Arten von Kosten, die sich selten in einer Kalkulation wiederfinden, aber real sind. Die erste ist offensichtlich: Zeit, die für das manuelle Öffnen, Zuordnen und Prüfen jeder einzelnen Datei aufgewendet wird, obwohl ein automatischer Schritt dieselbe Zuordnung in Sekunden treffen könnte. Bei einem überschaubaren monatlichen Volumen mag das kaum ins Gewicht fallen — bei mehreren hundert Eingangsrechnungen summiert sich dieser Aufwand schnell zu mehreren Arbeitsstunden im Monat.
Die zweite, subtilere Kostenart entsteht dort, wo eine Datei falsch eingeordnet wird — etwa ein ZUGFeRD-Dokument, das versehentlich wie ein einfaches PDF behandelt wird, wodurch die eingebettete, bereits strukturierte Information ungenutzt bleibt und stattdessen erneut mühsam aus dem visuellen Layout extrahiert werden muss. Diese Art von Fehler fällt selten sofort auf, führt aber über die Zeit zu einer spürbar geringeren Datenqualität, als eigentlich möglich wäre.
Eine nachvollziehbare Prüfspur
Ein oft übersehener Nebeneffekt der automatischen Formaterkennung ist die Dokumentation, die dabei entsteht. Da jedes erkannte Format als eigenes Feld im Export festgehalten wird, lässt sich im Nachhinein für jede einzelne Rechnung nachvollziehen, wie sie ursprünglich vorlag und wie sie verarbeitet wurde — eine Prüfspur, die bei einer internen Kontrolle oder einer Rückfrage der Steuerberatung wertvoll sein kann, ohne dass dafür ein eigenes Protokoll geführt werden müsste.
Für ein Unternehmen, das seine eigene Umstellung auf E-Rechnungen dokumentieren möchte — etwa um gegenüber der Geschäftsführung oder einem Prüfer den Digitalisierungsfortschritt zu belegen — ist diese automatisch mitgeführte Information ein praktischer Nebennutzen, der ohne zusätzlichen Aufwand entsteht.
Ein genauerer Blick auf die technische Prüfung
Wer wissen möchte, was hinter der Erkennung technisch tatsächlich passiert, findet die Antwort in der Struktur einer PDF-Datei selbst. Ein PDF nach dem Standard PDF/A-3, der auch für ZUGFeRD verwendet wird, erlaubt es, beliebige Dateien als Anhang direkt im Dokument einzubetten — ähnlich wie ein Anhang in einer E-Mail, nur dauerhaft mit dem PDF selbst verbunden. Die Erkennung öffnet das PDF, prüft, ob ein solcher eingebetteter Anhang mit dem erwarteten XML-Namen vorhanden ist, und liest bei einem Treffer dessen Inhalt direkt aus — ganz ohne den Umweg über eine visuelle Texterkennung, die für ein reines PDF sonst notwendig wäre.
Fehlt ein solcher eingebetteter Anhang, prüft die Erkennung im nächsten Schritt, ob die Datei selbst überhaupt eine PDF-Struktur besitzt. Ist das nicht der Fall, handelt es sich vermutlich um eine reine XML-Datei — die Erkennung prüft dann, ob diese XML einem der beiden für XRechnung zulässigen Syntaxen folgt, UBL (Universal Business Language) oder CII (Cross Industry Invoice), beides internationale Standards, auf denen auch der europäische Rahmenstandard EN 16931 aufbaut. Erst wenn auch diese Prüfung kein eindeutiges Ergebnis liefert, greift die visuelle Extraktion als letzter, verlässlicher Rückfallweg.
Dieser mehrstufige Aufbau ist bewusst so gewählt, dass er robust gegenüber Abweichungen einzelner Softwarehersteller bleibt — nicht jede Implementierung folgt jedem Detail der Spezifikation exakt, und eine Erkennung, die nur nach einem einzigen, starren Muster sucht, würde bei kleineren Abweichungen schnell versagen. Die schichtweise Prüfung von der spezifischsten zur allgemeinsten Möglichkeit sorgt dafür, dass auch untypische, aber im Kern korrekte Dateien zuverlässig erkannt werden.
Wie sich die Formatverteilung typischerweise entwickelt
Über die bisherige Beobachtung mehrerer Unternehmen mit unterschiedlichem Lieferantenstamm zeichnet sich ein wiederkehrendes Muster ab: Direkt nach dem Stichtag für die Empfangspflicht verändert sich die tatsächliche Formatverteilung im Posteingang zunächst kaum, da die meisten Lieferanten ihre eigene Versandpflicht noch gar nicht erreicht haben. Erst mit fortschreitender Zeit, wenn immer mehr Lieferanten ihre eigenen gestaffelten Fristen erreichen, steigt der Anteil strukturierter Formate spürbar an — ein Prozess, der sich eher über Jahre als über Monate vollzieht.
Für die eigene Planung bedeutet das: Ein formatunabhängiger Prozess, der heute eingerichtet wird, bleibt über die gesamte Dauer dieser allmählichen Verschiebung relevant, ohne dass er zwischenzeitlich angepasst werden müsste. Die automatische Erkennung passt sich der sich wandelnden Formatverteilung von selbst an, ohne dass jemand manuell nachjustieren müsste, sobald sich das Verhältnis zwischen PDF, ZUGFeRD und XRechnung im eigenen Posteingang verschiebt.
Wer diese Entwicklung über einen längeren Zeitraum verfolgt, gewinnt nebenbei einen praktischen Indikator dafür, wie weit die eigene Lieferantenbasis in ihrer Digitalisierung insgesamt fortgeschritten ist — eine Information, die sich sonst kaum systematisch erfassen ließe, hier aber als Nebenprodukt der ohnehin stattfindenden täglichen Verarbeitung anfällt.
Ein Vergleich über mehrere Quartale hinweg zeigt dabei oft deutlicher als jede einzelne Momentaufnahme, wie sich der eigene Lieferantenstamm insgesamt entwickelt — ein Anteil strukturierter Formate, der spürbar steigt, deutet auf eine aktive, insgesamt fortschreitende Digitalisierung der eigenen Geschäftsbeziehungen hin, während ein über längere Zeit stabiler Anteil eher auf einen festen Kern langjähriger, technisch weniger dynamischer Lieferanten hindeutet.
Jetzt eine Datei testen
Laden Sie eine echte XRechnung, ein ZUGFeRD-Dokument oder ein klassisches PDF hoch, um zu sehen, welches Format erkannt wird — ohne Registrierung.
Datenschutz
Der Upload erfolgt über TLS, durchgehend verschlüsselt.
Die Verarbeitung läuft auf Infrastruktur in der EU.
Originaldokumente werden unmittelbar nach der Verarbeitung gelöscht.
Rechnungsdaten werden nie zum Training von KI-Modellen verwendet.
Details zu Verschlüsselung und Löschfristen stehen auf der Seite zur Sicherheit.
