Rechnungseingang mit Abgleich
Zehn Belege, wie sie wirklich ankommen: PDF, Scan mit Stempel, schiefes Handyfoto, zerknitterter Bon, E-Rechnung. Vier Fehler und eine knappe Skontofrist sind eingebaut. Alle Firmen sind erfunden.
Warum das Ganze? Weil Abtippen Geld kostet.
PDF im Postfach, Brief mit Stempel, Foto vom Handy, Kassenbon aus der Jackentasche, dazu E-Rechnungen als XML. Jemand tippt die Werte ab, sucht Bestellung und Lieferschein heraus und vergleicht Zeile für Zeile.
Fast jede fünfte Rechnung wird zum Ausnahmefall, der von Hand geklärt werden muss: Menge stimmt nicht, Preis weicht ab, Bestellung fehlt. Bis eine Rechnung durch ist, vergehen im Schnitt über 9 Tage. Zahlen aus den USA, für Deutschland gibt es keine aktuellen.
Kein Abtippen mehr. Zu viel berechnete Mengen und doppelte Rechnungen fallen vor der Zahlung auf, nicht danach. Skontofristen gehen nicht mehr unter: 2 % für Zahlung in 10 statt 30 Tagen entsprechen aufs Jahr gerechnet 36,7 % Zins. Und jede Entscheidung ist nachvollziehbar.








Aufgezeichnet am 1.10.2026. Entwurfsstand: Die Gratis-Stufe von Gemini erlaubt 20 Anfragen pro Tag und Modell, deshalb stammen die Auslesen aus drei Gemini-Flash-Versionen. Der finale Lauf kommt komplett aus Gemini 3.8 Flash.
Kein Pilotprojekt. Fünf Punkte machen den Unterschied.
79 % der Firmen berichten, KI-Agenten einzuführen. Nur 11 % betreiben sie produktiv (Gartner 2026). Am Modell liegt das selten. Es liegt an diesen fünf Punkten.
Freigabe
Nichts wird automatisch bezahlt. Gelbe Fälle prüft ein Mensch, rote sind gesperrt, grüne bucht er mit einem Klick.
Nachvollziehbar
Jeder Wert zeigt seine Fundstelle im Original. Jeder Befund nennt Regel und Zahlen.
Rechte
Das Modell liest nur. Kein Schreibzugriff aufs ERP, kein Zugriff auf Zahlungen.
Kosten
0,48 US-Cent pro Beleg gemessen. 1.000 Belege im Monat: rund 4,16 €.
Test
188 von 189 Feldern, 8 von 9 Belegen komplett richtig. Alle 4 eingebauten Fehler und die Skontofrist gefunden.
Das Modell liest. Code rechnet.
Modell nur zum Lesen
Abgleich, Steuer und Pflichtangaben sind Regeln. Regeln gehören in Code: gleiche Eingabe, gleiches Ergebnis, nachrechenbar für die Buchhaltung.
E-Rechnung ohne Modell
Seit 2025 müssen Firmen E-Rechnungen empfangen können, ab 2027 oder 2028 auch ausstellen, je nach Umsatz. Das XML lese ich direkt: 0 Cent, 0 Fehler. KI nur dort, wo Papier ist.
Fundstelle vor Tempo
DeepSeek V4.1 Flash liest fast genauso gut (186 statt 188 von 189 Feldern) und ist 9,6× schneller. Aber die Rahmen liegen daneben, siehe unten. Ohne Fundstelle kann niemand prüfen, also Gemini.


| Modell | Belege | Felder richtig | Zeit Ø | Kosten Ø | Fundstellen |
|---|---|---|---|---|---|
| Gemini 3.8 Flash | 5 | 101/102 | 5,6 s | 0,50 US-Cent | präzise |
| Gemini 3.7 Flash | 3 | 61/61 | 5,2 s | 0,54 US-Cent | präzise |
| Gemini 3.6 Flash | 6 | 127/128 | 5,2 s | 0,44 US-Cent | präzise |
| DeepSeek V4.1 Flash | 9 | 186/189 | 0,5 s | 0,22 US-Cent | ungenau |
Alle 14 Gemini-Läufe zusammen: 289/291 Felder. Die 188/189 oben zählen die 9 Auslesen in der Demo. Zeiten auf der Gratis-Stufe, die bei Andrang gedrosselt wird. DeepSeek ist ein chinesischer Anbieter: für echte Kundendaten ein Minuspunkt.
Drei Fehler. Alle meine.
Doppelrechnung zuerst übersehen
Auf dem Foto liest das Modell „Weber & Söhne“, im PDF den vollen Firmennamen. Mein Abgleich nutzte den Namen als Schlüssel und sah zwei verschiedene Lieferanten. Jetzt: Rechnungsnummer plus Betrag.
Versandpauschale als „nicht geliefert“ gemeldet
Versand steht auf keinem Lieferschein. Der Abgleich meldete 8,21 € zu viel. Positionen ohne Lieferscheinzeile werden jetzt nicht mehr mengengeprüft.
Mein Testset lag falsch, nicht das Modell
Auf dem Kassenbon steht keine Menge. Das Modell schrieb korrekt „keine“, mein Testset erwartete 1. Zehn „Fehler“ verschwanden, als ich das Testset korrigierte.
* Richtwert aus Anbieterangaben inkl. Personalzeit. Ein Mensch prüft weiterhin die markierten Fälle, die Ersparnis ist also kleiner als die Differenz. Mittelstand: typisch 800–5.000 Eingangsrechnungen im Monat.
Cloud-API
Gemini 3.8 FlashDie Demo läuft mit erfundenen Belegen auf der Gratis-Stufe. Im Betrieb: bezahlte Stufe, kein Training mit Eingaben, AVV mit Google.
EU-Cloud
Vertex AI · europe-west3Gleiches Modell, Verarbeitung in Frankfurt. Umstellung: Endpunkt und Zugangsdaten.
Lokal
PaddleOCR-VL / Qwen3-VL-8BSoll auf einer Grafikkarte mit 16 GB laufen (Qwen3-VL-8B quantisiert). Messung auf meiner RTX 5070 Ti folgt, Ergebnis kommt hierher.