Vault-Dedup auf Captures erweitert + Standing-Cron
Wenn man täglich Artikel, Ideen und Recherchen in den eigenen Notiz-Eingang wirft, entsteht schnell ein unübersichtliches Duplikat-Chaos. Ich habe festgestellt, dass eine manuelle Bereinigung ab einer gewissen Menge schlicht nicht mehr machbar ist.
Automatische semantische Bereinigung
Bisher lief mein Skript zur Deduplizierung nur über das bereinigte Hauptarchiv meiner Wissensdatenbank. Ich habe diese Logik nun direkt auf den unstrukturierten Eingangskorb erweitert.
Das Prinzip: Ein lokales Skript nutzt Embeddings (Vektor-Darstellungen von Texten), um nicht nur exakte Kopien, sondern auch semantisch ähnliche Notizen zu erkennen. Wenn ich also zweimal denselben Gedanken oder denselben Artikel unter leicht unterschiedlichen Titeln speichere, erkennt die KI die inhaltliche Überschneidung zuverlässig.
Um das Ganze wirklich wartungsfrei zu machen, habe ich einen regelmäßigen Hintergrund-Job (Cronjob) eingerichtet. Anstatt die Bereinigung manuell anzustoßen, läuft der Prozess nun unbemerkt im Hintergrund. Der Eingangskorb bleibt sauber, und wenn ich die Notizen später für Produktkonzepte oder Recherchen weiterverarbeite, verschwende ich keine Zeit mehr mit doppelten Einträgen.
Für das eigene Setup
* Eingangskörbe frühzeitig filtern: Wendet KI-gestützte Ordnungssysteme nicht erst im Archiv an, sondern direkt dort, wo unstrukturierte Daten ins System fließen. * Semantik schlägt Dateinamen: Nutzt Embeddings zur Duplikat-Erkennung. Das ist wesentlich robuster als der simple Abgleich von Titeln, URLs oder Tags. * Automatisierung als Schlüssel: Regelmäßige Wartungsaufgaben des eigenen Wissensmanagements gehören in einen automatisierten Zeitplan, sonst bleiben sie im Arbeitsalltag auf der Strecke.