Paperless- Version 3.0 erschienen

und welchen wirklichen Benefit zur Version 2.20.15 stellst Du fest?

Hier werden die wichtigsten Neuerungen einmal vorgestellt: https://youtu.be/cyUqDVUk0r8?si=Wq30H95rwMrXwwr4 ; für mich alle irrelevant da ich es nicht im Unternehmen einsetze.

Viel Interessanter wäre wirklich die loklae KI Einbindung mit n8n.

Hallo nochmals in die Runde,

@Stefan: Kannst du uns schon einen Ausblick geben, bis wann das Update in die Masterclass aufgenommen wird?

Ich erhoffe mir mit der neuen Version u.a. die optionale Duplettenerkennung, da ich viele gleiche Dokumente verwalte (AGB’s usw.). Bisher war das ja nicht ohne Umwege möglich und könnte mit der neuen Version vermutl. auch produktiv gehen …

Danke dir für eine Rückmeldung!

Viele Grüße
Max

2 „Gefällt mir“

@Maxi sind denn die dokumente identisch sie werden jedesmal neu heruntergeladen oder sind im Emailanhang oder jedesmal neu eingescannt.
in der docker-compose.env kann man eintragen:

PAPERLESS_CONSUMER_DELETE_DUPLICATES= true

funktioniert in version 2.20.15 sowie auch in 3.0.5

Wäre mir neu, dass die genannte Einstellung dafür sorgt, dass beide (identische) Dokumente konsumiert werden können. Der Change Request wurde erst mit V3 umgesetzt –> Enhancement: allow duplicates with warnings, UI for discovery by shamoon · Pull Request #11815 · paperless-ngx/paperless-ngx · GitHub

Auch die Doku spricht von einem “pre-V3” Verhalten, mit welchem das Duplikat nicht verarbeitet wurde.

Ist zwar jetzt Off-Topic, aber vielleicht beschreibe ich meinen Use Case ausführlicher:

Paperless-ngx erkennt beim Upload mehrere inhaltlich identische Dokumente als Duplikate. Grundsätzlich ist dieses Verhalten sinnvoll, da dadurch verhindert wird, dass ein Dokument versehentlich mehrfach importiert wird.

In meinem Anwendungsfall sind die vermeintlichen Duplikate jedoch tatsächlich unterschiedliche Originaldateien. Beispielsweise kann dieselbe AGB an mehrere unterschiedliche Personen im Rahmen verschiedener Vertragsverhältnisse versendet worden sein. Die Dateien sind dabei inhaltlich und technisch identisch, gehören aber jeweils zu einem anderen Vorgang bzw. zu einer anderen Person.

Konkretes Beispiel

Angenommen, ich habe:

  • AGB für User A / Vertragsverhältnis A

  • AGB für User A / Vertragsverhältnis B

  • AGB für User B / Vertragsverhältnis C

Alle drei Dateien sind byte-identisch.

Paperless-ngx verarbeitet jedoch nur das zuerst hochgeladene Dokument. Die weiteren Dateien werden als Duplikate erkannt und nicht verarbeitet.

Damit geht für mich die Information verloren, welche konkrete Originaldatei zu welchem Vorgang gehört.

Ich kann zwar das bereits vorhandene Dokument manuell mehreren Vorgängen bzw. Personen zuordnen oder darauf verweisen. Das löst das Problem aber nicht vollständig: Es existiert weiterhin nur ein Dokumentobjekt bzw. eine Datei. Die tatsächlich vorliegende Originaldatei des jeweiligen Vorgangs wurde von Paperless-ngx nicht konsumiert und kann somit auch nicht unabhängig verarbeitet bzw. zugeordnet werden.

Aber davon unabhängig, würde ich mich auf V3 und die weiteren neuen Funktionen freuen und demnächst das Update durchzuführen wollen :slight_smile:

@maxi wenn du PAPERLESS_CONSUMER_DELETE_DUPLICATES= false setzt dann wird keine dupliketten prüfung durchgeführt. das bedeutet jedes dokument kann auch mehrmals vorhanden sein geht auch mit V2.20.15

1 „Gefällt mir“

Absolut der richtige Ansatz von RK - einen Tod muss man in diesem Anwendungsfall sterben.
Schön bei der 3.05 ist jedoch die Unterstützung von unterschiedlichen Versionen eines Dokumentes,

Das Problem ist das mit der Version 3 der default Wert geändert wurde

Hallo,

ich habe den Parameter jetzt nochmals unter 2.20.15 getestet. Leider konnte ich das beschriebene Verhalten nicht feststellen. Egal wie der Parameter ausgesteuert wird, wird das Duplikat nicht konsumiert.

Der Parameter steuert m.E. nur, ob das Duplikat im Scaninput Ordner nach erfolgter Duplikatsprüfung dauerhaft verbleiben soll oder nach der Prüfung gelöscht wird. Dies verhindert ein wiederholtes durchlaufen der Prüfung und ein unnötiges vergrößern des Protokolls “Dateiaufgaben”.

Das von mir gewünschte Verhalten wurde m.E. nach erst mit V3 - den Change habe ich bereits vorher gepostet - eingeführt. Dies ist dort genauso dokumentiert und deckt sich mit meinen Testergebnissen.

Sehr gerne könnt ihr mir das Gegenteil beweisen: Ich würde mich freuen, wenn ich Duplikate ohne Probleme bereits vor V3 in Paperless verwalten kann. Bitte beschreibt doch die notwendigen Einstellungen und wie die Dokumente importiert wurden.

PAPERLESS_CONSUMER_DELETE_DUPLICATES=false

falseAttribut

PAPERLESS_CONSUMER_DELETE_DUPLICATES=true

trueAttribut

As of version 3.0 Paperless-ngx allows duplicate documents to be consumed by default, except when this setting is enabled. When enabled, Paperless will check if a document with the same hash already exists in the system and delete the duplicate file from the consumption directory without consuming it.

Ab Version 3.0 lässt Paperless-ngx standardmäßig die Verarbeitung doppelter Dokumente zu, es sei denn, diese Einstellung ist aktiviert. Ist sie aktiviert, prüft Paperless, ob bereits ein Dokument mit demselben Hash im System vorhanden ist, und löscht die doppelte Datei aus dem Verarbeitungsverzeichnis, ohne sie zu verarbeiten.

ich habe diese in meiner docker-compose.env eingetragen.du muss dann
sudo docker compose down
sudo docker compose up -d
machen.
Bei mir funktioniert dieser Befehl auf meiner Test-Instanz. Ich habe diesen Befehl schon seit der Version 2.