Testbericht · September 2026
Wie genau liest KI Buchhaltungsbelege?
Wir haben vier Modellkonfigurationen über 4’801 Quittungen und Rechnungen und 400 Kontoauszugsdateien laufen lassen. Hier steht, was jede richtig macht, was sie kostet, wo sie scheitert – und was das für Ihre Kontrolle und die Daten Ihrer Kunden bedeutet.
Das Wichtigste
Eine Eingangsrechnung ist für die Buchhaltung erst brauchbar, wenn Datum, Rechnungsnummer, Gesamtbetrag und MWST-Betrag korrekt erfasst sind. Ogment liest diese Angaben aus Ihren Belegen, damit Ihr Team sie prüft, statt sie von Hand zu erfassen. Welche KI-Modelle dieses Lesen übernehmen und wie gut sie es tun, entscheiden wir anhand von Messungen. Dieser Bericht zeigt diese Messungen: jede Konfiguration, die wir vollständig getestet haben, gemessen an denselben Dokumenten und an bekannten Referenzwerten.
Eine Unterscheidung zieht sich durch alles: Einen Beleg zu lesen heisst noch nicht, ihn zu verbuchen. Die Tests messen, ob Angaben korrekt ausgelesen wurden. Sie messen weder die MWST-Behandlung noch die Kontierung noch die Bankabstimmung. Diese Entscheide bleiben Ihre fachliche Aufgabe.
- der Gesamtbeträge von Quittungen und Rechnungen liest die genaueste Konfiguration korrekt
- 99,24 %
- der Steuerbeträge auf echten Quittungen, beste Konfiguration: das schwächste Ergebnis bei Quittungen und Rechnungen
- 93,18 %
- so viel kostet die genaueste Konfiguration im Vergleich zu unserer Produktivkonfiguration, bei Quittungen und Rechnungen
- 11×
- der Datumsangaben und Saldi von Transaktionen auf Kontoauszügen liest die genaueste Konfiguration korrekt, bei Transaktionen, die dem Referenzwert zugeordnet wurden
- 99,99 %
- Die beste Konfiguration ist bei den wichtigsten Feldern sehr genau. Kimi K3 las 99,89 % der Belegarten, 99,80 % der Belegnummern, 99,24 % der Gesamtbeträge und 99,15 % der Datumsangaben korrekt. Unsere Produktivkonfiguration liegt bei jedem dieser Felder weniger als zwei Drittel eines Prozentpunkts dahinter.
- Die Fehler liegen bei den echten Quittungen. Bei synthetischen Dokumenten lesen die drei stärksten Konfigurationen (die Produktivkonfiguration, Kimi K3 und das Partnermodell) jedes der fünf Kernfelder in mindestens 99,39 % der Fälle korrekt. Bei echten Quittungen aus Geschäften und Restaurants lesen sie den Steuerbetrag in 89,32 % bis 93,18 % der Fälle korrekt.
- Mehr Genauigkeit kostet deutlich mehr. Kimi K3 kostet USD 39.49 pro 1’000 Dokumente, die Produktivkonfiguration USD 3.47: rund 11-mal so viel, für einen Gewinn von 0,13 bis 0,63 Prozentpunkten bei jedem der fünf exakten Felder.
- Ein Modell, das auf einen einzelnen Server in der Schweiz passt, war nicht gut genug. Qwen3-VL-30B ist günstig und seine Gewichte sind offen, aber es las nur 85,19 % der Steuerbeträge und 93,04 % der Belegarten korrekt und verarbeitete 326 von 400 Kontoauszugsdateien vollständig.
- Viele Fehler sind leere Felder, keine falschen Werte. Im Testlauf der Produktivkonfiguration waren 31 von 52 Fehlern beim Zwischentotal, 18 von 38 Steuerfehlern und 13 von 40 Datumsfehlern leer gelassene Felder. Ein leeres Feld fällt bei der Kontrolle auf; eine falsche Zahl nicht.
Was wir getestet haben
Eine Konfiguration ist das Modellpaar, das die Arbeit erledigt: Eines liest jede Seite, eines liest daraus die buchhalterischen Felder aus. Unsere Produktivkonfiguration verwendet für jeden Schritt ein anderes Modell, jeweils mit einem zweiten Modell als Ersatz. Die drei anderen Konfigurationen verwenden ein Modell für beide Schritte und kein Ersatzmodell; jedes Ergebnis zeigt also, was dieses Modell allein leistet. Die Gewichte eines Modells sind die Dateien, aus denen das trainierte Modell besteht; sind sie veröffentlicht («offen»), kann jeder das Modell auf eigenen Servern betreiben.
Die vier Konfigurationen
| Konfiguration | Liest die Seiten | Liest die Felder aus | Modellgewichte |
|---|---|---|---|
| Produktivkonfiguration | GPT-5 mini; Ersatz: Claude Haiku 4.5 | GPT-5.6 Luna; Ersatz: Claude Opus 4.6 | Geschlossen |
| Kimi K3 | Kimi K3 | Kimi K3 | Offen; rund 1,4 TB |
| Partnermodell | Proprietäres Modell eines Partners | Dasselbe Modell | Geschlossen |
| Qwen3-VL-30B | Qwen3-VL-30B | Qwen3-VL-30B | Offen (Apache 2.0); 62,2 GB |
Drei weitere Modelle erhielten keinen vollständigen Lauf. Zwei davon, Qwen3.5-27B und Qwen2.5-VL-72B, liessen sich mit unserer Dokumentenverarbeitung gar nicht betreiben. Mistral Small 3.2 schloss 95 Dokumente eines Versuchs mit 100 Dokumenten ab und las 68,10 % ihrer Steuerbeträge korrekt, was einen vollständigen Lauf nicht rechtfertigte.
Quittungen und Rechnungen
Der erste Testsatz umfasst 4’801 Dokumente aus drei öffentlichen Forschungsdatensätzen: 1’987 echte Quittungen aus Geschäften und Restaurants in Indonesien und Malaysia sowie 2’814 synthetische (computergenerierte) Rechnungen und Quittungen. Jedes Dokument bringt Referenzwerte mit. Ein Ergebnis ist für jedes Feld der Anteil der Referenzwerte, den die Konfiguration korrekt ausgelesen hat, gemittelt über die Datensätze, die für dieses Feld einen Referenzwert enthalten, wobei jeder Datensatz gleich viel zählt. Die echten Quittungen stammen aus dem Ausland; «Steuerbetrag» meint deshalb die darauf gedruckte Umsatz- oder Servicesteuer, nicht die Schweizer MWST.
Anteil korrekt gelesener Felder pro Konfiguration
| Was gemessen wurde | Produktivkonfiguration | Kimi K3 | Partnermodell | Qwen3-VL-30B |
|---|---|---|---|---|
| Belegart: Quittung oder Rechnung | 99,76 % | 99,89 % | 99,73 % | 93,04 % |
| Belegnummer | 99,39 % | 99,80 % | 99,59 % | 99,26 % |
| Gesamtbetrag | 98,61 % | 99,24 % | 98,92 % | 94,65 % |
| Belegdatum | 98,53 % | 99,15 % | 98,71 % | 98,28 % |
| Auf dem Beleg ausgewiesener Steuerbetrag | 95,96 % | 96,51 % | 94,53 % | 85,19 % |
| Lieferantenname (Übereinstimmungswert) | 95,81 % | 96,10 % | 96,04 % | 93,92 % |
| Lieferantenadresse (Übereinstimmungswert) | 94,97 % | 95,78 % | 95,37 % | 93,20 % |
| Positionstexte (Übereinstimmungswert) | 93,70 % | 94,73 % | 93,33 % | 92,61 % |
| Positionen mit ihren Beträgen (Übereinstimmungswert) | 96,11 % | 96,46 % | 96,04 % | 94,58 % |
| Verarbeitete Dokumente, nach erneuten Versuchen | 100,00 % | 100,00 % | 100,00 % | 99,04 % |
Drei der vier Konfigurationen liegen nahe beieinander. Kimi K3 ist in jeder Zeile allein oder gemeinsam an der Spitze, die Produktivkonfiguration und das Partnermodell wechseln sich dahinter ab, und die drei liegen bei jedem exakten Feld weniger als zwei Punkte auseinander. Qwen3-VL-30B ist eine andere Geschichte: konkurrenzfähig bei Datum und Belegnummer, deutlich zurück bei Steuer, Gesamtbetrag und Belegart.
Ein Ergebnis gilt für jeweils ein Feld. 99,24 % beim Gesamtbetrag bedeutet, dass rund 99 von 100 Gesamtbeträgen korrekt ausgelesen wurden. Es bedeutet nicht, dass 99,24 % der Belege vollständig korrekt waren, und es sagt nichts über den Anteil korrekter Buchungen aus.
Echte Quittungen und synthetische Dokumente
| Was gemessen wurde | Produktivkonfiguration | Kimi K3 | Partnermodell | Qwen3-VL-30B |
|---|---|---|---|---|
| Gesamtbetrag: echte Quittungen (CORD) | 98,15 % | 99,28 % | 98,05 % | 86,83 % |
| Gesamtbetrag: echte Quittungen (SROIE) | 97,67 % | 98,48 % | 98,78 % | 97,87 % |
| Gesamtbetrag: synthetische Dokumente | 100,00 % | 99,96 % | 99,93 % | 99,25 % |
| Steuerbetrag: echte Quittungen (CORD) | 92,05 % | 93,18 % | 89,32 % | – |
| Steuerbetrag: synthetische Dokumente | 99,87 % | 99,83 % | 99,75 % | – |
Falsche Werte pro 1’000, genaueste Konfiguration
Belegart
Echte Quittungen 1,5
Synthetische Dokumente 0,4
Gesamtbetrag
Echte Quittungen 11,2
Synthetische Dokumente 0,4
Belegdatum
Echte Quittungen 14,2
Synthetische Dokumente 2,8
Steuerbetrag
Echte Quittungen 68,2
Synthetische Dokumente 1,7
Das Muster ist bei den drei stärksten Konfigurationen dasselbe: Synthetische Dokumente sind nahezu gelöst, echte Quittungen nicht. Das ist wichtig, um jede Genauigkeitsaussage einzuordnen, auch unsere. Ein Test nur mit sauberen, generierten Rechnungen hätte jede der drei stärksten Konfigurationen bei jedem der fünf exakten Felder über 99 % gezeigt.
Kontoauszüge
Der zweite Testsatz umfasst 400 Kontoauszugsdateien: 200 synthetische Auszüge, Auszügen indischer Geschäftskonten nachempfunden, jeweils als digitales PDF und als gescannte Kopie. Ein Auszug ist eine schwierigere Aufgabe als eine Quittung: mehrere Seiten, viele Transaktionen, und jede Zeile muss gefunden sein, bevor ihre Felder stimmen können.
Vollständig verarbeitete Dateien
| Was gemessen wurde | Produktivkonfiguration | Kimi K3 | Partnermodell | Qwen3-VL-30B |
|---|---|---|---|---|
| Im ersten Durchgang abgeschlossen | 360 von 400 | 365 von 400 | 337 von 400 | 279 von 400 |
| Nach einem erneuten Versuch abgeschlossen | 382 von 400 | 384 von 400 | 372 von 400 | 326 von 400 |
| Anteil an allen 400 Dateien | 95,50 % | 96,00 % | 93,00 % | 81,50 % |
| Anteil an den 388 Dateien, die der Testaufbau annahm | 98,45 % | 98,97 % | 95,88 % | 84,02 % |
| Ergebnisse in der verlangten Struktur | 100,00 % | 99,48 % | 99,48 % | 87,63 % |
Keine Konfiguration verarbeitete alle Dateien. Neben diesen zwölf Dateien scheiterte die Produktivkonfiguration an 6 Dateien, Kimi K3 an 4, das Partnermodell an 16 und Qwen3-VL-30B an 62.
Korrekt gelesene Angaben der Auszüge pro Konfiguration
| Was gemessen wurde | Produktivkonfiguration | Kimi K3 | Partnermodell | Qwen3-VL-30B |
|---|---|---|---|---|
| Transaktionsdatum | 99,98 % | 99,99 % | 99,86 % | 98,21 % |
| Saldo nach jeder Transaktion | 99,88 % | 99,99 % | 99,95 % | 98,12 % |
| Transaktionsbetrag | 99,69 % | 99,59 % | 99,79 % | 99,24 % |
| Belastung oder Gutschrift | 98,60 % | 99,98 % | 99,83 % | 93,82 % |
| Buchungstext (Übereinstimmungswert) | 98,71 % | 99,53 % | 98,36 % | 92,79 % |
| Gefundene Transaktionszeilen (Zeilenwert) | 97,49 % | 97,85 % | 96,02 % | 87,41 % |
| Schlusssaldo | 95,50 % | 95,75 % | 93,00 % | 81,50 % |
| Kontonummer | 95,50 % | 95,25 % | 93,00 % | 81,50 % |
| Auszugsperiode | 95,50 % | 95,25 % | 93,00 % | 52,25 % |
Bei gefundenen Transaktionen lesen die drei stärksten Konfigurationen Datum, Betrag und Saldo in mindestens 99,59 % der Fälle korrekt. Die Unterschiede liegen anderswo. Die Produktivkonfiguration verwechselt Belastung und Gutschrift häufiger als Kimi K3 oder das Partnermodell: 98,60 % gegenüber 99,98 % und 99,83 %. Qwen3-VL-30B hat den tiefsten Zeilenwert und traf die Auszugsperiode bei kaum der Hälfte der Dateien.
Gescannte Kopien und digitale Originale
| Was gemessen wurde | Produktivkonfiguration | Kimi K3 | Partnermodell | Qwen3-VL-30B |
|---|---|---|---|---|
| Vollständig verarbeitete Dateien | +1,00 Pkt. | −1,00 Pkt. | −3,00 Pkt. | −14,00 Pkt. |
| Gefundene Transaktionszeilen (Zeilenwert) | +0,94 Pkt. | −1,02 Pkt. | −2,90 Pkt. | −14,04 Pkt. |
Scans kosten das Partnermodell rund drei Punkte und Qwen3-VL-30B vierzehn. Wenn Ihre Kunden Scans und Fotos statt Bankexporte schicken, ist dies die Tabelle, auf die es ankommt.
Kosten und Geschwindigkeit
Genauigkeit ist die eine Seite des Entscheids. Die andere ist, was der Betrieb einer Konfiguration kostet und wie lange ein Dokument braucht.
Kosten pro 1’000 Quittungen und Rechnungen
Qwen3-VL-30B
USD 1.36
Produktivkonfiguration
USD 3.47
Kimi K3
USD 39.49
Quittungen und Rechnungen: Kosten und Medianzeit
| Was gemessen wurde | Produktivkonfiguration | Kimi K3 | Partnermodell | Qwen3-VL-30B |
|---|---|---|---|---|
| Kosten pro 1’000 Dokumente | USD 3.47 | USD 39.49 | Kein öffentlicher Preis | USD 1.36 |
| Medianzeit pro Dokument | 200 s | 40 s | 11 s | 12 s |
Kontoauszüge: Kosten und Medianzeit
| Was gemessen wurde | Produktivkonfiguration | Kimi K3 | Partnermodell | Qwen3-VL-30B |
|---|---|---|---|---|
| Kosten pro 100 Dateien | USD 9.33 | USD 49.35 | Kein öffentlicher Preis | USD 11.10 |
| Medianzeit pro Datei | 452 s | 252 s | 201 s | 734 s |
Die genaueste Konfiguration ist zugleich mit grossem Abstand die teuerste: Kimi K3 kostet bei Quittungen und Rechnungen das 11,4-Fache der Produktivkonfiguration und bei Kontoauszügen das 5,3-Fache, gemessen an der von den Anbietern gemeldeten Nutzung. Bei den Kontoauszügen haben wir geprüft, was man dafür bekommt – 0,50 Punkte mehr vollständig verarbeitete Dateien, 0,36 Punkte beim Zeilenwert, 1,38 Punkte bei Belastung und Gutschrift –, und die Produktivkonfiguration behalten.
Qwen3-VL-30B ist bei Quittungen die günstigste Konfiguration und eine der zwei schnellsten. Bei Kontoauszügen ist es weder das eine noch das andere: Es ist die langsamste Konfiguration und kostet mehr als die Produktivkonfiguration.
Wo es schiefgeht
Durchschnitte verbergen, was eine Buchhalterin oder ein Buchhalter am dringendsten wissen muss: mit welchen Fehlern zu rechnen ist. Wir sind die Fehler Feld für Feld durchgegangen. Das sind die Muster, mit Zahlen aus dem Lauf der Produktivkonfiguration, sofern keine andere Konfiguration genannt ist.
Steuerbeträge auf echten Quittungen
Das schwächste Ergebnis bei Quittungen und Rechnungen. Von den 440 echten Quittungen mit einem Referenz-Steuerbetrag las die Produktivkonfiguration 405 korrekt, Kimi K3 410 und das Partnermodell 393. Bei den Quittungen, die danebengehen, fehlt typischerweise die Steuerzeile oder die Steuer ist mehrdeutig null; bei anderen wird eine Ziffer falsch gelesen oder der Betrag falsch hergeleitet. Fast die Hälfte der Steuerfehler der Produktivkonfiguration, 18 von 38, sind leer gelassene Felder und keine falschen Beträge.
Tausendertrennzeichen und Grössenordnung
Indonesische Quittungen schreiben sechsunddreissigtausend als 36.000, und eine frühere Version las einige davon als 36. Die Anweisungen verlangen vom Modell nun, solche Trennzeichen im Einklang mit der auf der Quittung gedruckten Arithmetik zu lesen. Zusammen mit den übrigen Änderungen derselben Runde stieg der Anteil korrekter Gesamtbeträge bei diesen Quittungen von 83,13 % auf 97,63 %. Dieselbe Mehrdeutigkeit besteht überall, wo Schreibweisen voneinander abweichen: 1’234.50 und 1.234,50 sind derselbe Betrag.
Datumsangaben
Die Produktivkonfiguration las 40 von 3’801 Datumsangaben falsch, dreizehn davon blieben leer. 23 der 40 betreffen gescannte Quittungen, wo die übliche Ursache eine falsch gelesene Ziffer oder ein kompaktes Datum ist, das sich auf zwei Arten lesen lässt; 17 betreffen synthetische Dokumente.
Belegnummern
Eine frühere Version gab oft die gedruckte Bezeichnung zusammen mit der Nummer zurück: «Order #INV-2024-089» statt «INV-2024-089». Das verursachte 19 ihrer 34 Fehler und ist behoben. Die 15 verbleibenden Fehler sind drei leere Felder sowie ausgelassene oder ersetzte Zeichen.
Quittungen, die für Rechnungen gehalten wurden
In einer früheren Version wurden 736 der 987 Quittungen eines Datensatzes als Rechnungen eingestuft. Seit wir neu geschrieben haben, wie die beiden unterschieden werden, werden 981 dieser 987 als Quittungen erkannt. Die Grafik unten zeigt die Veränderung für jede Dokumentgruppe.
Leere Felder
Wenn die Produktivkonfiguration an einem Feld scheitert, gibt sie oft nichts zurück statt eines falschen Werts: 31 von 52 Fehlern beim Zwischentotal, 18 von 38 Steuerfehlern, 13 von 40 Datumsfehlern und 10 von 41 Fehlern beim Gesamtbetrag waren leere Felder. Für die Kontrolle ist das die bessere Art Fehler, denn ein leeres Feld fällt auf und eine falsche Zahl nicht.
Läufe, die nicht zu Ende kommen
Jedes Modell liefert manchmal kein brauchbares Ergebnis: Ein Aufruf zum Lesen einer Seite läuft in ein Zeitlimit, oder die Antwort hat nicht die verlangte Struktur. Bei Quittungen und Rechnungen brauchte die Produktivkonfiguration 3 erneute Versuche, Kimi K3 hatte im ersten Durchgang 6 Fehlschläge und das Partnermodell 12, und alle drei schlossen jedes Dokument ab. Qwen3-VL-30B scheiterte im ersten Durchgang an 128 Dokumenten und hatte nach einem erneuten Versuch noch 46 offen.
Gescheiterte Dateien und Richtung auf Kontoauszügen
Auf Kontoauszügen ist der grösste Verlust eine Datei, die ganz scheitert. Bei den abgeschlossenen Dateien ist die Richtung die Hauptschwäche der Produktivkonfiguration: Sie ordnete Belastung oder Gutschrift bei 1,40 % der gefundenen Transaktionen falsch zu, gegenüber 0,02 % bei Kimi K3.
Dokumente mit richtiger Belegart, vor und nach der Korrektur
Echte Quittungen (SROIE)
Vorher 24,52 %
Nachher 99,39 %
Synthetische Quittungen
Vorher 83,28 %
Nachher 100,00 %
Echte Quittungen (CORD)
Vorher 98,80 %
Nachher 100,00 %
Synthetische Rechnungen
Vorher 99,95 %
Nachher 99,84 %
Ein zweiter Blick auf die Arithmetik
Eine Rechnung prüft sich selbst: Zwischentotal plus Steuer ergibt den Gesamtbetrag, und die Positionen ergeben das Zwischentotal. Nach dem obigen Vergleich haben wir diese Prüfung gebaut, zusammen mit einem zweiten Auslesedurchgang, und die Produktivkonfiguration am 10. September mit beidem erneut laufen lassen, an einem grösseren Satz von 5’301 Dokumenten, der zusätzlich 500 synthetische Kartenzahlungsbelege enthält (Belege von Kartenterminals, keine Schweizer Einzahlungsscheine).
- von 5’301 Dokumenten, deren ausgelesene Beträge nicht aufgingen
- 709
- Zwischentotale, die der zweite Durchgang änderte
- 232
- Steuerbeträge, die der zweite Durchgang änderte
- 43
- der Gesamtbeträge auf Kartenzahlungsbelegen korrekt gelesen
- 99,80 %
Dieser Lauf verwendet einen anderen Dokumentensatz; seine Ergebnisse lassen sich deshalb nicht mit den Tabellen oben zusammenführen. Er zeigt, wie oft die Arithmetik nicht aufgeht, und dass ein zweiter Durchgang tatsächlich Werte ändert: am häufigsten das Zwischentotal (232 Dokumente), dann die Lieferantenadresse (62), die Währung (60), die Belegnummer (44) und den Steuerbetrag (43). Ob jede Änderung eine Korrektur ist, ist eine eigene Messung.
Könnte die KI in der Schweiz laufen?
Treuhänderinnen und Treuhänder fragen, ob auch die KI-Modelle selbst in der Schweiz laufen könnten und nicht nur die Speicherung. Wir haben geprüft, was das für die zwei Konfigurationen mit offenen Modellgewichten bedeuten würde.
- Qwen3-VL-30B passt auf einen Server. Seine Gewichte sind 62,2 GB gross und passen auf eine einzelne Grafikkarte mit 96 GB. Ein Server mit dieser Karte ist bei einem Schweizer Anbieter für CHF 2’632 pro Monat gelistet und bei einem anderen für unter CHF 2’993, ohne Betrieb, Backup und einen zweiten Server für die Verfügbarkeit. Es ist aber die Konfiguration, die 85,19 % der Steuerbeträge korrekt las und 326 von 400 Auszugsdateien vollständig verarbeitete.
- Kimi K3 braucht einen Cluster. Seine Gewichte sind rund 1,4 TB gross. Sechzehn Grafikkarten in einem Schweizer Rechenzentrum kosten zum Listenpreis rund CHF 24’800 pro Monat, für eine Kapazität, die wir auf fünf bis zehn gleichzeitige Nutzer schätzen. Das ist keine Grundlage, um ein Produkt zu betreiben.
- Die Produktivkonfiguration und das Partnermodell lassen sich nicht selbst betreiben. Ihre Gewichte sind nicht veröffentlicht.
Heute besteht die Wahl unter den getesteten Konfigurationen also zwischen einem Modell, das wir in der Schweiz betreiben könnten, und einem Modell, das genau genug ist, und wir haben uns für die Genauigkeit entschieden. Ihre Dokumente werden in der Schweiz gespeichert; die KI-Verarbeitung findet in der Europäischen Union statt, zu den unten beschriebenen Bedingungen.
Preise: Öffentliche Listenpreise in Schweizer Franken, abgerufen am 4. September 2026 für den Kimi-K3-Cluster und am 9. September 2026 für den einzelnen Server. Die Kapazitätsangaben sind Schätzungen, keine Messungen.
So haben wir gemessen
- Dokumente mit bekannten Werten. Wir haben öffentliche Forschungsdatensätze verwendet, in denen jedes Dokument Referenzwerte mitbringt: das Datum, den Gesamtbetrag oder die Transaktionen, die tatsächlich darauf stehen. Es wurden keine Kundendokumente verwendet. Von den Quittungen und Rechnungen sind 1’987 echte Quittungen und 2’814 synthetische Dokumente; alle Kontoauszugsdateien sind synthetisch.
- Verarbeitung. Jede Konfiguration verarbeitete jedes Dokument so, wie es das Produkt tut: Jede Seite wurde gelesen, und die buchhalterischen Angaben wurden in festgelegte Felder wie Datum, Belegnummer, Gesamtbetrag und Steuerbetrag übertragen.
- Vergleich mit der Referenz. Jeder ausgelesene Wert wurde mit dem Referenzwert verglichen. Übliche Unterschiede im Datumsformat zählten nicht als Fehler: 31.03.2024 und 2024-03-31 sind dasselbe Datum. Beträge mussten auf den Rappen genau übereinstimmen; Belegnummern mussten abgesehen von Leerzeichen, Satzzeichen sowie Gross- und Kleinschreibung übereinstimmen.
- Auszählung. Für jedes Feld haben wir gezählt, wie viele Referenzwerte korrekt ausgelesen wurden. Dokumente ohne Referenzwert für ein Feld wurden dafür nicht berücksichtigt; gab es einen Referenzwert, aber keinen ausgelesenen Wert, zählte das als Fehler. Da 59 % der Quittungen und Rechnungen synthetisch sind, wurde jeder Wert zuerst innerhalb jedes Datensatzes berechnet und dann jeder Datensatz gleich gewichtet – so zählen echte Quittungen gleich viel wie synthetische Dokumente.
Zur Veranschaulichung, kein Testfall: Weist eine Rechnung einen Gesamtbetrag von CHF 108.10 aus, gilt ein ausgelesener Wert von 108.10 als richtig, 108.01 oder 1’081.00 dagegen als Fehler.
Bei Kontoauszügen wurde eine ausgelesene Zeile einer Referenzzeile nur zugeordnet, wenn beide bei Datum, Betrag, Saldo, Richtung (Belastung oder Gutschrift) und Buchungstext weitgehend übereinstimmten; die Paare mussten zudem der Reihenfolge des Auszugs folgen. Datum, Betrag und Saldo wurden anschliessend an den zugeordneten Zeilen geprüft. Eine Zeile, die zu abweichend gelesen wurde, um zugeordnet zu werden, zählt nicht als falscher Betrag: Sie senkt stattdessen den Zeilenwert, als fehlende Zeile und – falls sie ausgelesen wurde – als zusätzliche Zeile.
Die Datensätze sind CORD v2 (1’000 echte Quittungen aus Indonesien), ICDAR 2019 SROIE (987 echte gescannte Quittungen aus Malaysia), Invoice OCR Synthetic (2’814 synthetische Rechnungen und Quittungen) und Indian Bank Statements (400 synthetische Dateien). Die ersten drei sind unter der Lizenz CC BY 4.0 veröffentlicht, der vierte unter Apache 2.0; wir haben von jedem eine feste Version verwendet.
Was das für Ihre Kontrolle bedeutet
- Die Ergebnisse beschreiben die Testdokumente. Die echten Quittungen stammen aus Geschäften und Restaurants in Indonesien und Malaysia, nicht aus der Schweiz. Layouts, Sprachen und Scanqualität der Belege Ihrer Lieferanten können davon abweichen.
- Ein Teil der Testdaten ist synthetisch. Belegnummern wurden nur an synthetischen Dokumenten gemessen, und alle Kontoauszüge sind synthetisch, keine echten Schweizer Auszüge. Wie die Ergebnisse oben zeigen, sind synthetische Dokumente einfacher als echte.
- Ein korrektes Feld macht nicht den ganzen Beleg korrekt. Jedes Feld wird für sich gemessen.
- Scans sind schwieriger. Bei Kontoauszügen lagen die Ergebnisse für gescannte Kopien bei den drei stärksten Konfigurationen bis zu drei Punkte unter denen der digitalen Originale.
- Testergebnisse sind kein Versprechen. Sie beschreiben diese Läufe vom September 2026, nicht jedes Dokument, und die Konfiguration, die Ihre Dokumente verarbeitet, kann wechseln, wenn eine andere in diesen Tests besser abschneidet.
- Das fachliche Urteil bleibt bei Ihnen. Die Tests umfassten weder die MWST-Behandlung noch die Kontierung, die Abstimmung oder die Richtigkeit von Buchungen.
In der Praxis heisst das: Prüfen Sie ausgelesene Steuer- und Gesamtbeträge – besonders bei Quittungen –, bevor Sie sich darauf stützen, schauen Sie bei leeren Feldern zweimal hin, und kontrollieren Sie Kontoauszugsdaten wie jede andere Grundlage einer Abstimmung.
Wo die Daten Ihrer Kunden verarbeitet werden
Die Dokumente Ihrer Kunden sind vertraulich. Drei getrennte Fragen bestimmen, was mit ihnen geschieht – und wir beantworten jede einzeln.
Wo werden die Dokumente gespeichert?
In der Schweiz. Die Dokumente, die Sie in Ogment hochladen, werden in der Schweiz gespeichert.
Wo findet die KI-Verarbeitung statt?
Nur in der Europäischen Union. Wenn ein Dokument gelesen und seine Angaben ausgelesen werden, findet diese KI-Verarbeitung ausschliesslich in der EU statt.
Was behalten die KI-Anbieter?
Nicht den Inhalt Ihrer Dokumente. Gemäss unserer Zero-Data-Retention-Richtlinie (keine Aufbewahrung von Daten bei den KI-Anbietern nach der Verarbeitung) bewahren unsere KI-Anbieter weder den erhaltenen Dokumentinhalt noch die von ihnen erzeugten Antworten über den Abschluss der Verarbeitung hinaus auf. Unabhängig davon verwenden sie diese Inhalte nicht zum Training von KI-Modellen.
Zero Data Retention gilt für die KI-Anbieter. Es bedeutet nicht, dass Ogment Ihre Dokumente löscht: Sie bleiben in Ihrem Ogment-Arbeitsbereich in der Schweiz gespeichert, damit Ihr Team weiter damit arbeiten kann. Und «nicht für Training verwendet» und «nicht aufbewahrt» sind zwei verschiedene Zusagen – wir geben beide.
Gratis 30-Min.-KI-Audit