Komplexer Workflow vor Erfassung in Paperless

Moin.

Ich bin ein neuer Nutzer von Paperless und ich fuchse mich derzeit in die Vorgänge ein. Ich will paperless privat nutzen.

Mein Workflow zum Einscannen und Verarbeiten von Dokumenten sieht bisher so aus, dass ich für mehrere Tage oder Wochen alle Dokumente sammlen. Dann jage ich alle Dokumente (jeweils ca. 30 - 50 Seiten) durch den Kopierer im Büro. Heraus kommt ein Dokument als PDF-Datei mit dem aktuellen Datum als Dateinamen.

Dieses Dokument enthält somit viele unterschiedliche Dokumente,

  • teils einseitig, teils mehrseitig
  • ganz unterschiedliche Dokumente: Briefe, Rechnungen, mehrseitige Dokumente, Musik-Noten
  • in unterschiedlicher Ausrichtung
  • ganz unterschiedliche Absender.

Diese PDF-Dateien möchte ich so bearbeiten, dass sie als einzelne Dokumente in Paperless eingelesen werden können. Folgende Arbeitsschritte stehen an:

  • alle Leerseiten entfernen
  • Ausrichtung der Dokumente vereinheitlichen
  • Erkennung und Trennung der einzelnen Dokumente
  • Festlegen von Dateinamen aus Datum des Dokuments (z.B. Rechnungsdatum),
  • und Absender des Dokuments
  • Art des Dokuments z.B. Rechnung
  • Titel, Komponist des Musikstückes

Dann können die Dokumente mit diesen Dateinamen in Paperless eingelesen werden.

Und dann sollen die entsprechenden Tags und weiteren Eigenschaften in Paperless automatisch erfasst werden.

Gibt es dazu aus Werkzeuge in Paperless oder in einer KI? Welche wäre für eine solche Aufgabe am besten geeignet?

Kann man den PDF-Editor in Paperless durch einen anderen umfangreicheren Editor ersetzen?

Vielen Dank
Viele Grüße

Guido

Wenn Du schon so viele Dokumente einscannen musst ohne das sie gleich bei Paperless anscheinend landen dann verwende bezüglich einfacher Trennung ein Trennblatt, als Suchwort für das Internet Patch Code T

Hier findest du ein benötigtes Trennblatt

Trennblatt

1 „Gefällt mir“

Überleg Dir auch, ob Du nicht lieber zwei Stapel machst - einseitig/doppelseitig (mit Trennblättern). Dann mußt du nachher weniger manuell editieren.
Manche Scanner können eventuell auch Leerseiten erkennen und diese aus dem Scan gleich entfernen. Das findet man meistens im Handbuch des Scanners, wie man das Einstellen kann.

Ich bin jetzt eher auf dem Weg. Keep it simple.

Ich habe nur einmal eine PDF bekommen, die mangels anderer Möglichkeit einseitig eingescannt wurde, also die Rückseiten ab Seite 72 von 144. Inhalt: 12 Dokumente, die alle gleich aufgebaut waren, jeweils zwölf Seiten (Grundbuchauszüge). Die Seite 2 war immer leer. Habe ich dann die K.I. erledigen lassen: Diese hat das erst mal nicht auf die Reihe gebracht. Erstes Ergebnis: Ein Dokument mit 25 Seiten. LOL. Danach noch ein paar Fails. Erst nachdem ich die KI beleidigt habe und ihr im Prinzip gesagt habe, was die Kriterien sind, hat es geklappt. Das war innerhalb von 10 Minuten erledigt. Ergebnis waren dann 12 Doks mit aussagefähigem Titel – allemal schneller als mit einem PDF-Editor.

Ob das was du willst, in einem Workflow in einem Rutsch geht, kann ich nicht beurteilen, wird aber eher schwer. K. I. Sicherlich, aber da werden einige Prompts aufgrund der Unterschiedlichkeit der Dokumente notwendig sein.

Das ist so richtig aber in der Praxis funktioniert es oft aus banalen Gründen nicht… z.b. weil einschlüsse im Papier sind usw.

Da macht es mehr Sinn in Paperless-NGX die Seiten einfach zu entfernen oder mit nem externen Tool.

Hallo @Guido01

Bin gerade am Frickeln. Muss einfach ein paar Dinge geradeziehen, wie z. B. Datensicherung. Dabei bin ich nochmals über deinen Beitrag gestolpert.

Der Traum eines jeden IT-Dienstleisters. Kunde hat Software gekauft und macht sich dann erst Gedanken, was diese erledigen soll. Da wird dann kräftig fakturiert.
Du hast dich hier angemeldet und am selben Tag diesen Forderungskatalog gepostet. Ich denke, hier hilft nur eins: Lesen und Try and Error. Wenn du dich hier schlau machst, erledigen sich viele deiner Fragen von allein. Wenn da noch etwas offen sein sollte, bekommst du hier sicherlich auch gute Unterstützung. Es wird aber niemand deine Liste abarbeiten.
Alternative: Kurs buchen beim Betreiber des Forums.

Mein Tipp ist aber: Keep it simple. Paperless ist keine One-Click-Lösung. Ein hundert Seiten PDF in den Topf werfen und rühren, dann kommen dreißig sauber formatierte Dokumente raus, funktioniert sicherlich nicht. Außer du hast ausreichend Budget für Programmierer, ist ja Open Source.
Just my five cents

Moin zusammen,

herzlichen Dank schon mal für die Antworten und die Tips. Ich habe mich hier in den letzten Tagen zurück gehalten, da mein System an anderer Stelle deutliche Probleme bereitet:

Zunächst einmal ist nach einigen Tagen der Speicher voll gewesen. Und ich habe mit Claudes Hilfe die Daten gesichert und auf ein anderes Speichermedium übertragen. Anschließend habe ich den Raspi neu aufgesetzt und es lief auch einige Tage wieder. Mit einer neueren Version von paperless.

Dann ist der Raspi mit dem System wenige Tage darauf wieder ausgefallen. Derzeit mache ich mir wenige Sorgen um meine Daten, aber das System bekomme ich derzeit nicht stabil zum Laufen.

Insofern habe ich dort ein paar andere Baustellen, bevor ich mich wieder dem Thema Dokumentenmanagement widmen kann.

Derzeit plane ich das auf ein größeres System als HomeServer umzusetzen. Mit ThinClient, linux, Docker und Container für Paperless, NextCloud, und Hermes Agent. Das nimmt sicherlich noch deutlich Zeit in Anspruch, so dass ich erst anschließend wieder konkrete Fragen stellen kann und mich weiter in Paperless einarbeiten kann.

Herzlichen Dank schon für die Tips.
LG Guido

Ups sorry.
Asche auf mein Haupt. Ein Profi.
Hättest du ein paar Informationen, wie

Derzeit plane ich das auf ein größeres System als HomeServer umzusetzen. Mit ThinClient, linux, Docker und Container für Paperless, NextCloud, und Hermes Agent. Das nimmt sicherlich noch deutlich Zeit in Anspruch, so dass ich erst anschließend wieder konkrete Fragen stellen kann und mich weiter in Paperless einarbeiten kann.

vorab hier eingestellt, dann hätte ich die Füße ruhig gehalten. Das ist dann doch weit über meinem Wissen und Können.

In diesem Sinne