@Stefan: Kannst du uns schon einen Ausblick geben, bis wann das Update in die Masterclass aufgenommen wird?
Ich erhoffe mir mit der neuen Version u.a. die optionale Duplettenerkennung, da ich viele gleiche Dokumente verwalte (AGB’s usw.). Bisher war das ja nicht ohne Umwege möglich und könnte mit der neuen Version vermutl. auch produktiv gehen …
@Maxi sind denn die dokumente identisch sie werden jedesmal neu heruntergeladen oder sind im Emailanhang oder jedesmal neu eingescannt.
in der docker-compose.env kann man eintragen:
PAPERLESS_CONSUMER_DELETE_DUPLICATES= true
funktioniert in version 2.20.15 sowie auch in 3.0.5
Auch die Doku spricht von einem “pre-V3” Verhalten, mit welchem das Duplikat nicht verarbeitet wurde.
Ist zwar jetzt Off-Topic, aber vielleicht beschreibe ich meinen Use Case ausführlicher:
Paperless-ngx erkennt beim Upload mehrere inhaltlich identische Dokumente als Duplikate. Grundsätzlich ist dieses Verhalten sinnvoll, da dadurch verhindert wird, dass ein Dokument versehentlich mehrfach importiert wird.
In meinem Anwendungsfall sind die vermeintlichen Duplikate jedoch tatsächlich unterschiedliche Originaldateien. Beispielsweise kann dieselbe AGB an mehrere unterschiedliche Personen im Rahmen verschiedener Vertragsverhältnisse versendet worden sein. Die Dateien sind dabei inhaltlich und technisch identisch, gehören aber jeweils zu einem anderen Vorgang bzw. zu einer anderen Person.
Konkretes Beispiel
Angenommen, ich habe:
AGB für User A / Vertragsverhältnis A
AGB für User A / Vertragsverhältnis B
AGB für User B / Vertragsverhältnis C
Alle drei Dateien sind byte-identisch.
Paperless-ngx verarbeitet jedoch nur das zuerst hochgeladene Dokument. Die weiteren Dateien werden als Duplikate erkannt und nicht verarbeitet.
Damit geht für mich die Information verloren, welche konkrete Originaldatei zu welchem Vorgang gehört.
Ich kann zwar das bereits vorhandene Dokument manuell mehreren Vorgängen bzw. Personen zuordnen oder darauf verweisen. Das löst das Problem aber nicht vollständig: Es existiert weiterhin nur ein Dokumentobjekt bzw. eine Datei. Die tatsächlich vorliegende Originaldatei des jeweiligen Vorgangs wurde von Paperless-ngx nicht konsumiert und kann somit auch nicht unabhängig verarbeitet bzw. zugeordnet werden.
Aber davon unabhängig, würde ich mich auf V3 und die weiteren neuen Funktionen freuen und demnächst das Update durchzuführen wollen
@maxi wenn du PAPERLESS_CONSUMER_DELETE_DUPLICATES= false setzt dann wird keine dupliketten prüfung durchgeführt. das bedeutet jedes dokument kann auch mehrmals vorhanden sein geht auch mit V2.20.15
Absolut der richtige Ansatz von RK - einen Tod muss man in diesem Anwendungsfall sterben.
Schön bei der 3.05 ist jedoch die Unterstützung von unterschiedlichen Versionen eines Dokumentes,
ich habe den Parameter jetzt nochmals unter 2.20.15 getestet. Leider konnte ich das beschriebene Verhalten nicht feststellen. Egal wie der Parameter ausgesteuert wird, wird das Duplikat nicht konsumiert.
Der Parameter steuert m.E. nur, ob das Duplikat im Scaninput Ordner nach erfolgter Duplikatsprüfung dauerhaft verbleiben soll oder nach der Prüfung gelöscht wird. Dies verhindert ein wiederholtes durchlaufen der Prüfung und ein unnötiges vergrößern des Protokolls “Dateiaufgaben”.
Das von mir gewünschte Verhalten wurde m.E. nach erst mit V3 - den Change habe ich bereits vorher gepostet - eingeführt. Dies ist dort genauso dokumentiert und deckt sich mit meinen Testergebnissen.
Sehr gerne könnt ihr mir das Gegenteil beweisen: Ich würde mich freuen, wenn ich Duplikate ohne Probleme bereits vor V3 in Paperless verwalten kann. Bitte beschreibt doch die notwendigen Einstellungen und wie die Dokumente importiert wurden.
As of version 3.0 Paperless-ngx allows duplicate documents to be consumed by default, except when this setting is enabled. When enabled, Paperless will check if a document with the same hash already exists in the system and delete the duplicate file from the consumption directory without consuming it.
Ab Version 3.0 lässt Paperless-ngx standardmäßig die Verarbeitung doppelter Dokumente zu, es sei denn, diese Einstellung ist aktiviert. Ist sie aktiviert, prüft Paperless, ob bereits ein Dokument mit demselben Hash im System vorhanden ist, und löscht die doppelte Datei aus dem Verarbeitungsverzeichnis, ohne sie zu verarbeiten.
ich habe diese in meiner docker-compose.env eingetragen.du muss dann
sudo docker compose down
sudo docker compose up -d
machen.
Bei mir funktioniert dieser Befehl auf meiner Test-Instanz. Ich habe diesen Befehl schon seit der Version 2.