Neu: Remote-OCR für paperless-ngx aus Deutschland, die Alternative zu Azure. Feedback willkommen!

Hallo zusammen,

der eine oder andere von euch hat es sicherlich bemerkt: Es ist verhältnismäßig still gewesen bei YouTube und hier im Forum. Das lag daran, dass wir fleißig an einem Projekt gearbeitet haben, dass ich euch heute endlich präsentieren kann:

Vielleicht erinnert ihr euch noch an mein Video aus dem Januar, in dem ich einen Prototypen gezeigt habe, der paperless-ngx mit einer eigenen KI-OCR verbindet.

Das Feedback darauf war so groß, dass ich drangeblieben bin. Und da paperless-ngx seit der v3 eine Anbindung an eine Remote-OCR direkt mitbringt, lag es auf der Hand, daraus einen richtigen Service zu machen. Heute kann ich ihn euch endlich vorstellen:

Unser eigener API-Service: Texterkennung für paperless-ngx (ab v3)

Worum geht es?

Die Standard-OCR in paperless-ngx (Tesseract) ist für saubere Scans okay, aber bei Kassenbons, Kopien, schiefen Scans oder Tabellen wird es schnell eng. Und gerade die Zahlen (Beträge, Belegnummern, Datum) sind ja das, wonach man später sucht.

paperless-ocr.de ersetzt genau diesen Schritt:

  • Texterkennung läuft auf unseren eigenen Servern in Deutschland, ihr braucht keine eigene GPU
  • Ihr bekommt Volltext für paperless und ein durchsuchbares PDF mit Textlayer zurück (auf Wunsch auch PDF/A)
  • Kein Sprachmodell, d.h. es wird kein Text „erfunden“
  • Einrichtung: drei Umgebungsvariablen in der docker-compose.env, Container neu starten, fertig

Der Härtetest: ein echter Kassenbon

Für die Website habe ich bewusst keinen schönen Beispiel-Beleg genommen, sondern einen echten Kassenbon aus dem Supermarkt: Thermopapier, geknickt, mit Kugelschreiber bekritzelt, ganz normal mit dem Dokumentenscanner eingescannt.

Ergebnis bei 23 buchhaltungsrelevanten Angaben (Beträge, Steuern, Belegnummer, Datum usw.):

  • Tesseract (Standard in paperless-ngx): 13 von 23 richtig
  • paperless-ocr.de: 23 von 23 richtig

Aus der Summe 9,67 € wird bei Tesseract z.B. „9,08/“, aus der Belegnummer 2943 wird 2343. Viel Spaß beim Wiederfinden :wink:

Ihr könnt das auch selbst nachprüfen: Auf der Seite liegen beide PDFs zum Download. Sucht darin einfach nach der Belegnummer 2943, nur eines der beiden findet sie.

Warum nicht einfach paperless-gpt?

Die Frage kam schon ein paar mal. paperless-gpt und Co. schreiben meist nur den Text in die Datenbank, das archivierte PDF bleibt ohne brauchbaren Textlayer (Suchen, Markieren, Kopieren im PDF geht dann nicht). Außerdem landen die Dokumente dort oft bei einer US-Cloud-KI, wenn man keinen eigenen KI-Server hat.
Man kann beides übrigens auch kombinieren: unsere OCR für Text und PDF, ein Sprachmodell für Titel und Tags.

Datenschutz

Mir war wichtig, dass ich den Dienst selbst mit gutem Gewissen nutzen würde:

  • Verarbeitung ausschließlich in Deutschland, deutsche GmbH, keine US-Clouddienste in der Kette
  • Dokumente werden nur für die Verarbeitung kurz zwischengespeichert und direkt nach der Abholung gelöscht (spätestens nach einer Stunde)
  • Kein Training mit euren Dokumenten
  • Für Firmen: AVV direkt bei der Bestellung, somit auch DSGVO-konform nutzbar
  • Sogar beim Kreditkarten-Zahlungprovider haben wir uns für einen europäischen entschieden (Mollie), auch wenn uns das etwas mehr kostet als die etablierten Lösungen.

Preise

  • Privat: 3,99 € / Monat (inkl. MwSt.) für 50 Seiten
  • Business S: 14,99 € / Monat (zzgl. USt.) für 1.000 Seiten
  • Business M: 29,99 € / Monat (zzgl. USt.) für 3.000 Seiten

Alles monatlich kündbar, berechnet werden nur erfolgreich erkannte Seiten. Wenn ihr in einen größeren Tarif wechselt, gilt das höhere Kontingent sofort.

Eure Meinung ist gefragt!

Mir ist Transparenz und Offenheit sehr wichtig. Daher frage ich auch offen im Forum, wo es jeder lesen kann:

  • Passen die Tarife zu euren Seitenzahlen? Wie viele Seiten scannt ihr so im Monat?
  • Fehlt euch ein Tarif (z.B. einmalig für den Altbestand)?
  • Welche Dokumente machen bei euch mit Tesseract die meisten Probleme?
  • Ist irgendetwas auf der Website unklar oder fehlt euch etwas zum Thema Datenschutz?
  • Und vor allem für die ersten Kunden: Wie ist eure Erfahrung mit unserem Service? Lob, Kritik, alles gerne offen kommentieren.

Schreibt es gerne hier unter den Post, dann haben alle etwas davon.

Danke für euer Feedback!

Schöne Grüße
Stefan

Das es still war ist aufgefallen :grinning_face: und dachte mir schon das du vermutlich woran arbeiten wirst.

Neue Dinge sind immer spannend, gibts news zu den „pausierten“ Projekten KI-Server und so ?

Bin am überlegen meine 9070XT mal für KI unter Ubuntu oder so im Dual-Boot zu testen.

Mir erschließt sich als Privatperson der Sinn nicht ganz danach da ich rückwärts suchend nie nach Belegnummer usw. suchen würde, aber jeder mag das anders sehen.

Als Firma/Gewerbetreibender wie DU sicherlich sinnvoll für die Buchhaltung.

Ich finde das Projekt cool für jemanden der tatsächlich seine Kassenbons ( warum auch immer ) digitalisiert… und bisher auch Problem hatte, mir viel persönlich nie groß grobe fehler im OCR-Text auf.

KI-Hype hin oder her…

Fände da nen On-Demand Tarif eher sinnig um nur bei bedarf die sache zu nutzen, Ich selbst würde kein Abo Model wählen und scanne auch keine 50 Seiten im Monat mehr da die meisten Rechnungen und Co. Digital kommen.

Bin kein großer Freund mehr von Abos aber wenn monatlich kündbar finde ich das echt cool mal zum Testen.

Ab… Ich glaube 2027 wird sich das mit den Kassenbons sowieso ändern wenn du das mitbekommen hast mit der QR-CODE Pflicht an den Kassen wie du sicherlich mitbekommen hast ?

Hab das nur am rande mitbekommen und ob 2027 oder später später ist relativ, hoffe dann nur das die dann als PDF speicherbar sind oder mit wenig Aufwand ein PDF draus erstellt werden kann… Nicht wie bei Decathlon als Bild das man dann erst zuschneiden muss und dann als PDF speichern ^^