Hallo zusammen,
der eine oder andere von euch hat es sicherlich bemerkt: Es ist verhältnismäßig still gewesen bei YouTube und hier im Forum. Das lag daran, dass wir fleißig an einem Projekt gearbeitet haben, dass ich euch heute endlich präsentieren kann:
Vielleicht erinnert ihr euch noch an mein Video aus dem Januar, in dem ich einen Prototypen gezeigt habe, der paperless-ngx mit einer eigenen KI-OCR verbindet.
Das Feedback darauf war so groß, dass ich drangeblieben bin. Und da paperless-ngx seit der v3 eine Anbindung an eine Remote-OCR direkt mitbringt, lag es auf der Hand, daraus einen richtigen Service zu machen. Heute kann ich ihn euch endlich vorstellen:
Unser eigener API-Service: Texterkennung für paperless-ngx (ab v3)
Worum geht es?
Die Standard-OCR in paperless-ngx (Tesseract) ist für saubere Scans okay, aber bei Kassenbons, Kopien, schiefen Scans oder Tabellen wird es schnell eng. Und gerade die Zahlen (Beträge, Belegnummern, Datum) sind ja das, wonach man später sucht.
paperless-ocr.de ersetzt genau diesen Schritt:
- Texterkennung läuft auf unseren eigenen Servern in Deutschland, ihr braucht keine eigene GPU
- Ihr bekommt Volltext für paperless und ein durchsuchbares PDF mit Textlayer zurück (auf Wunsch auch PDF/A)
- Kein Sprachmodell, d.h. es wird kein Text „erfunden“
- Einrichtung: drei Umgebungsvariablen in der docker-compose.env, Container neu starten, fertig
Der Härtetest: ein echter Kassenbon
Für die Website habe ich bewusst keinen schönen Beispiel-Beleg genommen, sondern einen echten Kassenbon aus dem Supermarkt: Thermopapier, geknickt, mit Kugelschreiber bekritzelt, ganz normal mit dem Dokumentenscanner eingescannt.
Ergebnis bei 23 buchhaltungsrelevanten Angaben (Beträge, Steuern, Belegnummer, Datum usw.):
- Tesseract (Standard in paperless-ngx): 13 von 23 richtig
- paperless-ocr.de: 23 von 23 richtig
Aus der Summe 9,67 € wird bei Tesseract z.B. „9,08/“, aus der Belegnummer 2943 wird 2343. Viel Spaß beim Wiederfinden ![]()
Ihr könnt das auch selbst nachprüfen: Auf der Seite liegen beide PDFs zum Download. Sucht darin einfach nach der Belegnummer 2943, nur eines der beiden findet sie.
Warum nicht einfach paperless-gpt?
Die Frage kam schon ein paar mal. paperless-gpt und Co. schreiben meist nur den Text in die Datenbank, das archivierte PDF bleibt ohne brauchbaren Textlayer (Suchen, Markieren, Kopieren im PDF geht dann nicht). Außerdem landen die Dokumente dort oft bei einer US-Cloud-KI, wenn man keinen eigenen KI-Server hat.
Man kann beides übrigens auch kombinieren: unsere OCR für Text und PDF, ein Sprachmodell für Titel und Tags.
Datenschutz
Mir war wichtig, dass ich den Dienst selbst mit gutem Gewissen nutzen würde:
- Verarbeitung ausschließlich in Deutschland, deutsche GmbH, keine US-Clouddienste in der Kette
- Dokumente werden nur für die Verarbeitung kurz zwischengespeichert und direkt nach der Abholung gelöscht (spätestens nach einer Stunde)
- Kein Training mit euren Dokumenten
- Für Firmen: AVV direkt bei der Bestellung, somit auch DSGVO-konform nutzbar
- Sogar beim Kreditkarten-Zahlungprovider haben wir uns für einen europäischen entschieden (Mollie), auch wenn uns das etwas mehr kostet als die etablierten Lösungen.
Preise
- Privat: 3,99 € / Monat (inkl. MwSt.) für 50 Seiten
- Business S: 14,99 € / Monat (zzgl. USt.) für 1.000 Seiten
- Business M: 29,99 € / Monat (zzgl. USt.) für 3.000 Seiten
Alles monatlich kündbar, berechnet werden nur erfolgreich erkannte Seiten. Wenn ihr in einen größeren Tarif wechselt, gilt das höhere Kontingent sofort.
Eure Meinung ist gefragt!
Mir ist Transparenz und Offenheit sehr wichtig. Daher frage ich auch offen im Forum, wo es jeder lesen kann:
- Passen die Tarife zu euren Seitenzahlen? Wie viele Seiten scannt ihr so im Monat?
- Fehlt euch ein Tarif (z.B. einmalig für den Altbestand)?
- Welche Dokumente machen bei euch mit Tesseract die meisten Probleme?
- Ist irgendetwas auf der Website unklar oder fehlt euch etwas zum Thema Datenschutz?
- Und vor allem für die ersten Kunden: Wie ist eure Erfahrung mit unserem Service? Lob, Kritik, alles gerne offen kommentieren.
Schreibt es gerne hier unter den Post, dann haben alle etwas davon.
Danke für euer Feedback!
Schöne Grüße
Stefan