Das ist @O.

KI-Online-Workshop am 14. Oktober - lernen Sie mit anderen Treuhändern.KI-Online-Workshop am 14. OktoberAnmelden
Gratis 30-Min.-KI-Audit

Testbericht · September 2026

Wie genau liest KI Buchhaltungsbelege?

Wir haben vier Modellkonfigurationen über 4’801 Quittungen und Rechnungen und 400 Kontoauszugsdateien laufen lassen. Hier steht, was jede richtig macht, was sie kostet, wo sie scheitert – und was das für Ihre Kontrolle und die Daten Ihrer Kunden bedeutet.

Das Wichtigste

Eine Eingangsrechnung ist für die Buchhaltung erst brauchbar, wenn Datum, Rechnungsnummer, Gesamtbetrag und MWST-Betrag korrekt erfasst sind. Ogment liest diese Angaben aus Ihren Belegen, damit Ihr Team sie prüft, statt sie von Hand zu erfassen. Welche KI-Modelle dieses Lesen übernehmen und wie gut sie es tun, entscheiden wir anhand von Messungen. Dieser Bericht zeigt diese Messungen: jede Konfiguration, die wir vollständig getestet haben, gemessen an denselben Dokumenten und an bekannten Referenzwerten.

Eine Unterscheidung zieht sich durch alles: Einen Beleg zu lesen heisst noch nicht, ihn zu verbuchen. Die Tests messen, ob Angaben korrekt ausgelesen wurden. Sie messen weder die MWST-Behandlung noch die Kontierung noch die Bankabstimmung. Diese Entscheide bleiben Ihre fachliche Aufgabe.

der Gesamtbeträge von Quittungen und Rechnungen liest die genaueste Konfiguration korrekt
99,24 %
der Steuerbeträge auf echten Quittungen, beste Konfiguration: das schwächste Ergebnis bei Quittungen und Rechnungen
93,18 %
so viel kostet die genaueste Konfiguration im Vergleich zu unserer Produktivkonfiguration, bei Quittungen und Rechnungen
11×
der Datumsangaben und Saldi von Transaktionen auf Kontoauszügen liest die genaueste Konfiguration korrekt, bei Transaktionen, die dem Referenzwert zugeordnet wurden
99,99 %
  • Die beste Konfiguration ist bei den wichtigsten Feldern sehr genau. Kimi K3 las 99,89 % der Belegarten, 99,80 % der Belegnummern, 99,24 % der Gesamtbeträge und 99,15 % der Datumsangaben korrekt. Unsere Produktivkonfiguration liegt bei jedem dieser Felder weniger als zwei Drittel eines Prozentpunkts dahinter.
  • Die Fehler liegen bei den echten Quittungen. Bei synthetischen Dokumenten lesen die drei stärksten Konfigurationen (die Produktivkonfiguration, Kimi K3 und das Partnermodell) jedes der fünf Kernfelder in mindestens 99,39 % der Fälle korrekt. Bei echten Quittungen aus Geschäften und Restaurants lesen sie den Steuerbetrag in 89,32 % bis 93,18 % der Fälle korrekt.
  • Mehr Genauigkeit kostet deutlich mehr. Kimi K3 kostet USD 39.49 pro 1’000 Dokumente, die Produktivkonfiguration USD 3.47: rund 11-mal so viel, für einen Gewinn von 0,13 bis 0,63 Prozentpunkten bei jedem der fünf exakten Felder.
  • Ein Modell, das auf einen einzelnen Server in der Schweiz passt, war nicht gut genug. Qwen3-VL-30B ist günstig und seine Gewichte sind offen, aber es las nur 85,19 % der Steuerbeträge und 93,04 % der Belegarten korrekt und verarbeitete 326 von 400 Kontoauszugsdateien vollständig.
  • Viele Fehler sind leere Felder, keine falschen Werte. Im Testlauf der Produktivkonfiguration waren 31 von 52 Fehlern beim Zwischentotal, 18 von 38 Steuerfehlern und 13 von 40 Datumsfehlern leer gelassene Felder. Ein leeres Feld fällt bei der Kontrolle auf; eine falsche Zahl nicht.

Was wir getestet haben

Eine Konfiguration ist das Modellpaar, das die Arbeit erledigt: Eines liest jede Seite, eines liest daraus die buchhalterischen Felder aus. Unsere Produktivkonfiguration verwendet für jeden Schritt ein anderes Modell, jeweils mit einem zweiten Modell als Ersatz. Die drei anderen Konfigurationen verwenden ein Modell für beide Schritte und kein Ersatzmodell; jedes Ergebnis zeigt also, was dieses Modell allein leistet. Die Gewichte eines Modells sind die Dateien, aus denen das trainierte Modell besteht; sind sie veröffentlicht («offen»), kann jeder das Modell auf eigenen Servern betreiben.

Die vier Konfigurationen

KonfigurationLiest die SeitenLiest die Felder ausModellgewichte
ProduktivkonfigurationGPT-5 mini; Ersatz: Claude Haiku 4.5GPT-5.6 Luna; Ersatz: Claude Opus 4.6Geschlossen
Kimi K3Kimi K3Kimi K3Offen; rund 1,4 TB
PartnermodellProprietäres Modell eines PartnersDasselbe ModellGeschlossen
Qwen3-VL-30BQwen3-VL-30BQwen3-VL-30BOffen (Apache 2.0); 62,2 GB
Die Produktivkonfiguration ist dasselbe Paar aus Modellen und Anweisungen, das zum Zeitpunkt der Tests Kundendokumente verarbeitete, hier in einem Testaufbau an den Testdokumenten ausgeführt. Das Partnermodell ist ein proprietäres Modell eines Partners, das über dessen eigene Schnittstelle angesprochen wird; wir nennen es nicht, und es hat keinen öffentlichen Preis.

Drei weitere Modelle erhielten keinen vollständigen Lauf. Zwei davon, Qwen3.5-27B und Qwen2.5-VL-72B, liessen sich mit unserer Dokumentenverarbeitung gar nicht betreiben. Mistral Small 3.2 schloss 95 Dokumente eines Versuchs mit 100 Dokumenten ab und las 68,10 % ihrer Steuerbeträge korrekt, was einen vollständigen Lauf nicht rechtfertigte.

Quittungen und Rechnungen

Der erste Testsatz umfasst 4’801 Dokumente aus drei öffentlichen Forschungsdatensätzen: 1’987 echte Quittungen aus Geschäften und Restaurants in Indonesien und Malaysia sowie 2’814 synthetische (computergenerierte) Rechnungen und Quittungen. Jedes Dokument bringt Referenzwerte mit. Ein Ergebnis ist für jedes Feld der Anteil der Referenzwerte, den die Konfiguration korrekt ausgelesen hat, gemittelt über die Datensätze, die für dieses Feld einen Referenzwert enthalten, wobei jeder Datensatz gleich viel zählt. Die echten Quittungen stammen aus dem Ausland; «Steuerbetrag» meint deshalb die darauf gedruckte Umsatz- oder Servicesteuer, nicht die Schweizer MWST.

Anteil korrekt gelesener Felder pro Konfiguration

Was gemessen wurdeProduktivkonfigurationKimi K3PartnermodellQwen3-VL-30B
Belegart: Quittung oder Rechnung99,76 %99,89 %99,73 %93,04 %
Belegnummer99,39 %99,80 %99,59 %99,26 %
Gesamtbetrag98,61 %99,24 %98,92 %94,65 %
Belegdatum98,53 %99,15 %98,71 %98,28 %
Auf dem Beleg ausgewiesener Steuerbetrag95,96 %96,51 %94,53 %85,19 %
Lieferantenname (Übereinstimmungswert)95,81 %96,10 %96,04 %93,92 %
Lieferantenadresse (Übereinstimmungswert)94,97 %95,78 %95,37 %93,20 %
Positionstexte (Übereinstimmungswert)93,70 %94,73 %93,33 %92,61 %
Positionen mit ihren Beträgen (Übereinstimmungswert)96,11 %96,46 %96,04 %94,58 %
Verarbeitete Dokumente, nach erneuten Versuchen100,00 %100,00 %100,00 %99,04 %
4’801 Dokumente, September 2026; der beste Wert jeder Zeile ist fett, hier wie in den folgenden Tabellen. Die ersten fünf Zeilen sind exakte Übereinstimmungen. Die Zeilen zu Lieferant und Positionen sind Übereinstimmungswerte, die fehlende wie überflüssige Inhalte bestrafen; sie sind deshalb mit den Zeilen darüber nicht vergleichbar. Für Belegnummern gibt es nur im synthetischen Datensatz einen Referenzwert. Qwen3-VL-30B erhielt nur einen erneuten Versuch; die anderen drei wurden wiederholt, bis jedes Dokument abgeschlossen war.

Drei der vier Konfigurationen liegen nahe beieinander. Kimi K3 ist in jeder Zeile allein oder gemeinsam an der Spitze, die Produktivkonfiguration und das Partnermodell wechseln sich dahinter ab, und die drei liegen bei jedem exakten Feld weniger als zwei Punkte auseinander. Qwen3-VL-30B ist eine andere Geschichte: konkurrenzfähig bei Datum und Belegnummer, deutlich zurück bei Steuer, Gesamtbetrag und Belegart.

Ein Ergebnis gilt für jeweils ein Feld. 99,24 % beim Gesamtbetrag bedeutet, dass rund 99 von 100 Gesamtbeträgen korrekt ausgelesen wurden. Es bedeutet nicht, dass 99,24 % der Belege vollständig korrekt waren, und es sagt nichts über den Anteil korrekter Buchungen aus.

Echte Quittungen und synthetische Dokumente

Was gemessen wurdeProduktivkonfigurationKimi K3PartnermodellQwen3-VL-30B
Gesamtbetrag: echte Quittungen (CORD)98,15 %99,28 %98,05 %86,83 %
Gesamtbetrag: echte Quittungen (SROIE)97,67 %98,48 %98,78 %97,87 %
Gesamtbetrag: synthetische Dokumente100,00 %99,96 %99,93 %99,25 %
Steuerbetrag: echte Quittungen (CORD)92,05 %93,18 %89,32 %–
Steuerbetrag: synthetische Dokumente99,87 %99,83 %99,75 %–
Gesamtbeträge und Steuerbeträge nach Datensatz. CORD und SROIE sind echte Quittungen; für den Steuerbetrag gibt es bei 440 der CORD-Quittungen einen Referenzwert und bei keiner der SROIE-Quittungen. «–» steht für einen Ausschnitt, der für diese Konfiguration nicht veröffentlicht wurde.

Falsche Werte pro 1’000, genaueste Konfiguration

  • Belegart

    Echte Quittungen 1,5

    Synthetische Dokumente 0,4

  • Gesamtbetrag

    Echte Quittungen 11,2

    Synthetische Dokumente 0,4

  • Belegdatum

    Echte Quittungen 14,2

    Synthetische Dokumente 2,8

  • Steuerbetrag

    Echte Quittungen 68,2

    Synthetische Dokumente 1,7

Kimi K3: wie viele von je 1’000 Referenzwerten falsch gelesen oder leer gelassen wurden, bei echten Quittungen und bei synthetischen Dokumenten.

Das Muster ist bei den drei stärksten Konfigurationen dasselbe: Synthetische Dokumente sind nahezu gelöst, echte Quittungen nicht. Das ist wichtig, um jede Genauigkeitsaussage einzuordnen, auch unsere. Ein Test nur mit sauberen, generierten Rechnungen hätte jede der drei stärksten Konfigurationen bei jedem der fünf exakten Felder über 99 % gezeigt.

Kontoauszüge

Der zweite Testsatz umfasst 400 Kontoauszugsdateien: 200 synthetische Auszüge, Auszügen indischer Geschäftskonten nachempfunden, jeweils als digitales PDF und als gescannte Kopie. Ein Auszug ist eine schwierigere Aufgabe als eine Quittung: mehrere Seiten, viele Transaktionen, und jede Zeile muss gefunden sein, bevor ihre Felder stimmen können.

Vollständig verarbeitete Dateien

Was gemessen wurdeProduktivkonfigurationKimi K3PartnermodellQwen3-VL-30B
Im ersten Durchgang abgeschlossen360 von 400365 von 400337 von 400279 von 400
Nach einem erneuten Versuch abgeschlossen382 von 400384 von 400372 von 400326 von 400
Anteil an allen 400 Dateien95,50 %96,00 %93,00 %81,50 %
Anteil an den 388 Dateien, die der Testaufbau annahm98,45 %98,97 %95,88 %84,02 %
Ergebnisse in der verlangten Struktur100,00 %99,48 %99,48 %87,63 %
Für Dateien, die im ersten Durchgang scheiterten, war ein erneuter Versuch erlaubt. Zwölf der 400 Dateien haben fünf Seiten, wo der Test sechs erwartet, und wurden ausgesondert, bevor ein Modell sie sah; die vierte Zeile lässt nur diese zwölf weg.

Keine Konfiguration verarbeitete alle Dateien. Neben diesen zwölf Dateien scheiterte die Produktivkonfiguration an 6 Dateien, Kimi K3 an 4, das Partnermodell an 16 und Qwen3-VL-30B an 62.

Korrekt gelesene Angaben der Auszüge pro Konfiguration

Was gemessen wurdeProduktivkonfigurationKimi K3PartnermodellQwen3-VL-30B
Transaktionsdatum99,98 %99,99 %99,86 %98,21 %
Saldo nach jeder Transaktion99,88 %99,99 %99,95 %98,12 %
Transaktionsbetrag99,69 %99,59 %99,79 %99,24 %
Belastung oder Gutschrift98,60 %99,98 %99,83 %93,82 %
Buchungstext (Übereinstimmungswert)98,71 %99,53 %98,36 %92,79 %
Gefundene Transaktionszeilen (Zeilenwert)97,49 %97,85 %96,02 %87,41 %
Schlusssaldo95,50 %95,75 %93,00 %81,50 %
Kontonummer95,50 %95,25 %93,00 %81,50 %
Auszugsperiode95,50 %95,25 %93,00 %52,25 %
Die ersten fünf Zeilen sind über Transaktionen berechnet, die gefunden und dem Referenzwert zugeordnet wurden. Die letzten vier sind über alle 400 Dateien berechnet, jede gescheiterte Datei zählt also als falsch, auch die zwölf vor der Verarbeitung ausgesonderten (3 Punkte bei jeder Konfiguration); der Zeilenwert berücksichtigt zudem fehlende und zusätzliche Transaktionen. Bei den Dateien, die sie abschloss, las die Produktivkonfiguration Schlusssaldo, Kontonummer und Auszugsperiode jedes Mal korrekt.

Bei gefundenen Transaktionen lesen die drei stärksten Konfigurationen Datum, Betrag und Saldo in mindestens 99,59 % der Fälle korrekt. Die Unterschiede liegen anderswo. Die Produktivkonfiguration verwechselt Belastung und Gutschrift häufiger als Kimi K3 oder das Partnermodell: 98,60 % gegenüber 99,98 % und 99,83 %. Qwen3-VL-30B hat den tiefsten Zeilenwert und traf die Auszugsperiode bei kaum der Hälfte der Dateien.

Gescannte Kopien und digitale Originale

Was gemessen wurdeProduktivkonfigurationKimi K3PartnermodellQwen3-VL-30B
Vollständig verarbeitete Dateien+1,00 Pkt.−1,00 Pkt.−3,00 Pkt.−14,00 Pkt.
Gefundene Transaktionszeilen (Zeilenwert)+0,94 Pkt.−1,02 Pkt.−2,90 Pkt.−14,04 Pkt.
Gescannt minus digital, in Prozentpunkten, bei den 200 gepaarten Auszügen. Der kleine Vorsprung der Produktivkonfiguration bei Scans ist Rauschen aus den erneuten Versuchen und kein Beleg dafür, dass Scans einfacher wären.

Scans kosten das Partnermodell rund drei Punkte und Qwen3-VL-30B vierzehn. Wenn Ihre Kunden Scans und Fotos statt Bankexporte schicken, ist dies die Tabelle, auf die es ankommt.

Kosten und Geschwindigkeit

Genauigkeit ist die eine Seite des Entscheids. Die andere ist, was der Betrieb einer Konfiguration kostet und wie lange ein Dokument braucht.

Kosten pro 1’000 Quittungen und Rechnungen

  • Qwen3-VL-30B

    USD 1.36

  • Produktivkonfiguration

    USD 3.47

  • Kimi K3

    USD 39.49

US-Dollar zu den veröffentlichten Preisen der Anbieter vom September 2026, für die hier gezeigten Läufe. Der Wert von Qwen3-VL-30B ist die beobachtete Nutzung und enthält 40 gescheiterte Aufrufe nicht. Das Partnermodell hat keinen öffentlichen Preis und ist nicht dargestellt.

Quittungen und Rechnungen: Kosten und Medianzeit

Was gemessen wurdeProduktivkonfigurationKimi K3PartnermodellQwen3-VL-30B
Kosten pro 1’000 DokumenteUSD 3.47USD 39.49Kein öffentlicher PreisUSD 1.36
Medianzeit pro Dokument200 s40 s11 s12 s
Der tiefste Wert jeder Zeile ist fett. US-Dollar zu den veröffentlichten Preisen der Anbieter vom September 2026, für die hier gezeigten Ergebnisse. Die Kosten von Qwen3-VL-30B sind nur die beobachtete Nutzung; seine 40 gescheiterten Aufrufe zum Lesen einer Seite sind nicht enthalten. Die Medianzeit reicht vom Senden eines Dokuments bis zum Eintreffen des Ergebnisses; jeder Lauf wurde unter anderer Last gemessen, die Zeiten zeigen also eine Grössenordnung und keinen kontrollierten Geschwindigkeitstest, und jene der Produktivkonfiguration ist durch eine Warteschlange vor dem Lesen der Seiten überhöht.

Kontoauszüge: Kosten und Medianzeit

Was gemessen wurdeProduktivkonfigurationKimi K3PartnermodellQwen3-VL-30B
Kosten pro 100 DateienUSD 9.33USD 49.35Kein öffentlicher PreisUSD 11.10
Medianzeit pro Datei452 s252 s201 s734 s
Der tiefste Wert jeder Zeile ist fett. Die Kosten sind die Nutzung, die die Anbieter für den ganzen Lauf gemeldet haben, gescheiterte Versuche eingeschlossen; Aufrufe mit unvollständigen Nutzungsdaten sind nicht gezählt, es sind also Untergrenzen. Eine Auszugsdatei hat fünf oder sechs Seiten.

Die genaueste Konfiguration ist zugleich mit grossem Abstand die teuerste: Kimi K3 kostet bei Quittungen und Rechnungen das 11,4-Fache der Produktivkonfiguration und bei Kontoauszügen das 5,3-Fache, gemessen an der von den Anbietern gemeldeten Nutzung. Bei den Kontoauszügen haben wir geprüft, was man dafür bekommt – 0,50 Punkte mehr vollständig verarbeitete Dateien, 0,36 Punkte beim Zeilenwert, 1,38 Punkte bei Belastung und Gutschrift –, und die Produktivkonfiguration behalten.

Qwen3-VL-30B ist bei Quittungen die günstigste Konfiguration und eine der zwei schnellsten. Bei Kontoauszügen ist es weder das eine noch das andere: Es ist die langsamste Konfiguration und kostet mehr als die Produktivkonfiguration.

Wo es schiefgeht

Durchschnitte verbergen, was eine Buchhalterin oder ein Buchhalter am dringendsten wissen muss: mit welchen Fehlern zu rechnen ist. Wir sind die Fehler Feld für Feld durchgegangen. Das sind die Muster, mit Zahlen aus dem Lauf der Produktivkonfiguration, sofern keine andere Konfiguration genannt ist.

  • Steuerbeträge auf echten Quittungen

    Das schwächste Ergebnis bei Quittungen und Rechnungen. Von den 440 echten Quittungen mit einem Referenz-Steuerbetrag las die Produktivkonfiguration 405 korrekt, Kimi K3 410 und das Partnermodell 393. Bei den Quittungen, die danebengehen, fehlt typischerweise die Steuerzeile oder die Steuer ist mehrdeutig null; bei anderen wird eine Ziffer falsch gelesen oder der Betrag falsch hergeleitet. Fast die Hälfte der Steuerfehler der Produktivkonfiguration, 18 von 38, sind leer gelassene Felder und keine falschen Beträge.

  • Tausendertrennzeichen und Grössenordnung

    Indonesische Quittungen schreiben sechsunddreissigtausend als 36.000, und eine frühere Version las einige davon als 36. Die Anweisungen verlangen vom Modell nun, solche Trennzeichen im Einklang mit der auf der Quittung gedruckten Arithmetik zu lesen. Zusammen mit den übrigen Änderungen derselben Runde stieg der Anteil korrekter Gesamtbeträge bei diesen Quittungen von 83,13 % auf 97,63 %. Dieselbe Mehrdeutigkeit besteht überall, wo Schreibweisen voneinander abweichen: 1’234.50 und 1.234,50 sind derselbe Betrag.

  • Datumsangaben

    Die Produktivkonfiguration las 40 von 3’801 Datumsangaben falsch, dreizehn davon blieben leer. 23 der 40 betreffen gescannte Quittungen, wo die übliche Ursache eine falsch gelesene Ziffer oder ein kompaktes Datum ist, das sich auf zwei Arten lesen lässt; 17 betreffen synthetische Dokumente.

  • Belegnummern

    Eine frühere Version gab oft die gedruckte Bezeichnung zusammen mit der Nummer zurück: «Order #INV-2024-089» statt «INV-2024-089». Das verursachte 19 ihrer 34 Fehler und ist behoben. Die 15 verbleibenden Fehler sind drei leere Felder sowie ausgelassene oder ersetzte Zeichen.

  • Quittungen, die für Rechnungen gehalten wurden

    In einer früheren Version wurden 736 der 987 Quittungen eines Datensatzes als Rechnungen eingestuft. Seit wir neu geschrieben haben, wie die beiden unterschieden werden, werden 981 dieser 987 als Quittungen erkannt. Die Grafik unten zeigt die Veränderung für jede Dokumentgruppe.

  • Leere Felder

    Wenn die Produktivkonfiguration an einem Feld scheitert, gibt sie oft nichts zurück statt eines falschen Werts: 31 von 52 Fehlern beim Zwischentotal, 18 von 38 Steuerfehlern, 13 von 40 Datumsfehlern und 10 von 41 Fehlern beim Gesamtbetrag waren leere Felder. Für die Kontrolle ist das die bessere Art Fehler, denn ein leeres Feld fällt auf und eine falsche Zahl nicht.

  • Läufe, die nicht zu Ende kommen

    Jedes Modell liefert manchmal kein brauchbares Ergebnis: Ein Aufruf zum Lesen einer Seite läuft in ein Zeitlimit, oder die Antwort hat nicht die verlangte Struktur. Bei Quittungen und Rechnungen brauchte die Produktivkonfiguration 3 erneute Versuche, Kimi K3 hatte im ersten Durchgang 6 Fehlschläge und das Partnermodell 12, und alle drei schlossen jedes Dokument ab. Qwen3-VL-30B scheiterte im ersten Durchgang an 128 Dokumenten und hatte nach einem erneuten Versuch noch 46 offen.

  • Gescheiterte Dateien und Richtung auf Kontoauszügen

    Auf Kontoauszügen ist der grösste Verlust eine Datei, die ganz scheitert. Bei den abgeschlossenen Dateien ist die Richtung die Hauptschwäche der Produktivkonfiguration: Sie ordnete Belastung oder Gutschrift bei 1,40 % der gefundenen Transaktionen falsch zu, gegenüber 0,02 % bei Kimi K3.

Dokumente mit richtiger Belegart, vor und nach der Korrektur

  • Echte Quittungen (SROIE)

    Vorher 24,52 %

    Nachher 99,39 %

  • Synthetische Quittungen

    Vorher 83,28 %

    Nachher 100,00 %

  • Echte Quittungen (CORD)

    Vorher 98,80 %

    Nachher 100,00 %

  • Synthetische Rechnungen

    Vorher 99,95 %

    Nachher 99,84 %

Dieselben 4’801 Dokumente, Produktivkonfiguration. Eine Gruppe wurde leicht schlechter: 3 von 1’857 synthetischen Rechnungen werden nun falsch eingestuft, zuvor war es 1.

Ein zweiter Blick auf die Arithmetik

Eine Rechnung prüft sich selbst: Zwischentotal plus Steuer ergibt den Gesamtbetrag, und die Positionen ergeben das Zwischentotal. Nach dem obigen Vergleich haben wir diese Prüfung gebaut, zusammen mit einem zweiten Auslesedurchgang, und die Produktivkonfiguration am 10. September mit beidem erneut laufen lassen, an einem grösseren Satz von 5’301 Dokumenten, der zusätzlich 500 synthetische Kartenzahlungsbelege enthält (Belege von Kartenterminals, keine Schweizer Einzahlungsscheine).

von 5’301 Dokumenten, deren ausgelesene Beträge nicht aufgingen
709
Zwischentotale, die der zweite Durchgang änderte
232
Steuerbeträge, die der zweite Durchgang änderte
43
der Gesamtbeträge auf Kartenzahlungsbelegen korrekt gelesen
99,80 %

Dieser Lauf verwendet einen anderen Dokumentensatz; seine Ergebnisse lassen sich deshalb nicht mit den Tabellen oben zusammenführen. Er zeigt, wie oft die Arithmetik nicht aufgeht, und dass ein zweiter Durchgang tatsächlich Werte ändert: am häufigsten das Zwischentotal (232 Dokumente), dann die Lieferantenadresse (62), die Währung (60), die Belegnummer (44) und den Steuerbetrag (43). Ob jede Änderung eine Korrektur ist, ist eine eigene Messung.

Könnte die KI in der Schweiz laufen?

Treuhänderinnen und Treuhänder fragen, ob auch die KI-Modelle selbst in der Schweiz laufen könnten und nicht nur die Speicherung. Wir haben geprüft, was das für die zwei Konfigurationen mit offenen Modellgewichten bedeuten würde.

  • Qwen3-VL-30B passt auf einen Server. Seine Gewichte sind 62,2 GB gross und passen auf eine einzelne Grafikkarte mit 96 GB. Ein Server mit dieser Karte ist bei einem Schweizer Anbieter für CHF 2’632 pro Monat gelistet und bei einem anderen für unter CHF 2’993, ohne Betrieb, Backup und einen zweiten Server für die Verfügbarkeit. Es ist aber die Konfiguration, die 85,19 % der Steuerbeträge korrekt las und 326 von 400 Auszugsdateien vollständig verarbeitete.
  • Kimi K3 braucht einen Cluster. Seine Gewichte sind rund 1,4 TB gross. Sechzehn Grafikkarten in einem Schweizer Rechenzentrum kosten zum Listenpreis rund CHF 24’800 pro Monat, für eine Kapazität, die wir auf fünf bis zehn gleichzeitige Nutzer schätzen. Das ist keine Grundlage, um ein Produkt zu betreiben.
  • Die Produktivkonfiguration und das Partnermodell lassen sich nicht selbst betreiben. Ihre Gewichte sind nicht veröffentlicht.

Heute besteht die Wahl unter den getesteten Konfigurationen also zwischen einem Modell, das wir in der Schweiz betreiben könnten, und einem Modell, das genau genug ist, und wir haben uns für die Genauigkeit entschieden. Ihre Dokumente werden in der Schweiz gespeichert; die KI-Verarbeitung findet in der Europäischen Union statt, zu den unten beschriebenen Bedingungen.

Preise: Öffentliche Listenpreise in Schweizer Franken, abgerufen am 4. September 2026 für den Kimi-K3-Cluster und am 9. September 2026 für den einzelnen Server. Die Kapazitätsangaben sind Schätzungen, keine Messungen.

So haben wir gemessen

  1. Dokumente mit bekannten Werten. Wir haben öffentliche Forschungsdatensätze verwendet, in denen jedes Dokument Referenzwerte mitbringt: das Datum, den Gesamtbetrag oder die Transaktionen, die tatsächlich darauf stehen. Es wurden keine Kundendokumente verwendet. Von den Quittungen und Rechnungen sind 1’987 echte Quittungen und 2’814 synthetische Dokumente; alle Kontoauszugsdateien sind synthetisch.
  2. Verarbeitung. Jede Konfiguration verarbeitete jedes Dokument so, wie es das Produkt tut: Jede Seite wurde gelesen, und die buchhalterischen Angaben wurden in festgelegte Felder wie Datum, Belegnummer, Gesamtbetrag und Steuerbetrag übertragen.
  3. Vergleich mit der Referenz. Jeder ausgelesene Wert wurde mit dem Referenzwert verglichen. Übliche Unterschiede im Datumsformat zählten nicht als Fehler: 31.03.2024 und 2024-03-31 sind dasselbe Datum. Beträge mussten auf den Rappen genau übereinstimmen; Belegnummern mussten abgesehen von Leerzeichen, Satzzeichen sowie Gross- und Kleinschreibung übereinstimmen.
  4. Auszählung. Für jedes Feld haben wir gezählt, wie viele Referenzwerte korrekt ausgelesen wurden. Dokumente ohne Referenzwert für ein Feld wurden dafür nicht berücksichtigt; gab es einen Referenzwert, aber keinen ausgelesenen Wert, zählte das als Fehler. Da 59 % der Quittungen und Rechnungen synthetisch sind, wurde jeder Wert zuerst innerhalb jedes Datensatzes berechnet und dann jeder Datensatz gleich gewichtet – so zählen echte Quittungen gleich viel wie synthetische Dokumente.

Zur Veranschaulichung, kein Testfall: Weist eine Rechnung einen Gesamtbetrag von CHF 108.10 aus, gilt ein ausgelesener Wert von 108.10 als richtig, 108.01 oder 1’081.00 dagegen als Fehler.

Bei Kontoauszügen wurde eine ausgelesene Zeile einer Referenzzeile nur zugeordnet, wenn beide bei Datum, Betrag, Saldo, Richtung (Belastung oder Gutschrift) und Buchungstext weitgehend übereinstimmten; die Paare mussten zudem der Reihenfolge des Auszugs folgen. Datum, Betrag und Saldo wurden anschliessend an den zugeordneten Zeilen geprüft. Eine Zeile, die zu abweichend gelesen wurde, um zugeordnet zu werden, zählt nicht als falscher Betrag: Sie senkt stattdessen den Zeilenwert, als fehlende Zeile und – falls sie ausgelesen wurde – als zusätzliche Zeile.

Die Datensätze sind CORD v2 (1’000 echte Quittungen aus Indonesien), ICDAR 2019 SROIE (987 echte gescannte Quittungen aus Malaysia), Invoice OCR Synthetic (2’814 synthetische Rechnungen und Quittungen) und Indian Bank Statements (400 synthetische Dateien). Die ersten drei sind unter der Lizenz CC BY 4.0 veröffentlicht, der vierte unter Apache 2.0; wir haben von jedem eine feste Version verwendet.

Was das für Ihre Kontrolle bedeutet

  • Die Ergebnisse beschreiben die Testdokumente. Die echten Quittungen stammen aus Geschäften und Restaurants in Indonesien und Malaysia, nicht aus der Schweiz. Layouts, Sprachen und Scanqualität der Belege Ihrer Lieferanten können davon abweichen.
  • Ein Teil der Testdaten ist synthetisch. Belegnummern wurden nur an synthetischen Dokumenten gemessen, und alle Kontoauszüge sind synthetisch, keine echten Schweizer Auszüge. Wie die Ergebnisse oben zeigen, sind synthetische Dokumente einfacher als echte.
  • Ein korrektes Feld macht nicht den ganzen Beleg korrekt. Jedes Feld wird für sich gemessen.
  • Scans sind schwieriger. Bei Kontoauszügen lagen die Ergebnisse für gescannte Kopien bei den drei stärksten Konfigurationen bis zu drei Punkte unter denen der digitalen Originale.
  • Testergebnisse sind kein Versprechen. Sie beschreiben diese Läufe vom September 2026, nicht jedes Dokument, und die Konfiguration, die Ihre Dokumente verarbeitet, kann wechseln, wenn eine andere in diesen Tests besser abschneidet.
  • Das fachliche Urteil bleibt bei Ihnen. Die Tests umfassten weder die MWST-Behandlung noch die Kontierung, die Abstimmung oder die Richtigkeit von Buchungen.

In der Praxis heisst das: Prüfen Sie ausgelesene Steuer- und Gesamtbeträge – besonders bei Quittungen –, bevor Sie sich darauf stützen, schauen Sie bei leeren Feldern zweimal hin, und kontrollieren Sie Kontoauszugsdaten wie jede andere Grundlage einer Abstimmung.

Wo die Daten Ihrer Kunden verarbeitet werden

Die Dokumente Ihrer Kunden sind vertraulich. Drei getrennte Fragen bestimmen, was mit ihnen geschieht – und wir beantworten jede einzeln.

  • Wo werden die Dokumente gespeichert?

    In der Schweiz. Die Dokumente, die Sie in Ogment hochladen, werden in der Schweiz gespeichert.

  • Wo findet die KI-Verarbeitung statt?

    Nur in der Europäischen Union. Wenn ein Dokument gelesen und seine Angaben ausgelesen werden, findet diese KI-Verarbeitung ausschliesslich in der EU statt.

  • Was behalten die KI-Anbieter?

    Nicht den Inhalt Ihrer Dokumente. Gemäss unserer Zero-Data-Retention-Richtlinie (keine Aufbewahrung von Daten bei den KI-Anbietern nach der Verarbeitung) bewahren unsere KI-Anbieter weder den erhaltenen Dokumentinhalt noch die von ihnen erzeugten Antworten über den Abschluss der Verarbeitung hinaus auf. Unabhängig davon verwenden sie diese Inhalte nicht zum Training von KI-Modellen.

Zero Data Retention gilt für die KI-Anbieter. Es bedeutet nicht, dass Ogment Ihre Dokumente löscht: Sie bleiben in Ihrem Ogment-Arbeitsbereich in der Schweiz gespeichert, damit Ihr Team weiter damit arbeiten kann. Und «nicht für Training verwendet» und «nicht aufbewahrt» sind zwei verschiedene Zusagen – wir geben beide.

Teo BorschbergCEO, Ogment

Gratis 30-Min.-KI-Audit buchen

  • Zeitaufwand Ihres Teams pro Mandat
  • Welche Workflows ein KI-Agent zuerst übernehmen kann
  • Eine klare KI-ROI-Schätzung für Ihre Treuhand
Unternehmensgrösse