Babierlos-BL – Handbuch

Version 0.6.3 „stabil“ · Dokumentenarchiv für ein papierloses Büro unter Windows · Einzelplatz

Was ist Babierlos-BL?

Babierlos-BL sammelt Ihre Papier- und Digitaldokumente an einem Ort: Scans, Handyfotos, PDFs aus E-Mails und vorhandene Ordner werden importiert, per Texterkennung (OCR) durchsuchbar gemacht, mit Datum, Korrespondent, Dokumenttyp und Tags versehen und in einem Archivordner auf Ihrem Rechner abgelegt. Die Suche findet Wörter im gesamten Dokumententext.

Grundgedanke: Ihre Daten bleiben in offenen Formaten (PDF + JSON) in einem normalen Ordner. Das Programm ist austauschbar, die Dokumente bleiben lesbar. Alles läuft lokal – es gibt keine Cloud, und Ihre Dokumente verlassen den Rechner nie. Die einzige Verbindung ins Internet ist die Abfrage, ob es eine neue Version gibt (höchstens einmal täglich, abschaltbar – siehe „Neue Versionen“).

Installation

Alle Downloads auf einen Blick (Stand 30.09.2026). Im Programm stehen dieselben Links – mit Statusanzeige, was schon vorhanden ist – unter Einstellungen → Systemprüfung sowie beim ersten Start im Willkommensfenster. Auch start_babierlos_bl.bat --check listet fehlende Teile samt Link.
WasWozuDownload
Python 3.10 oder neuerFührt das Programm aus (bei der EXE-Version nicht nötig)python.org/downloads/windows
Tesseract-OCRTexterkennung (Scans und Fotos werden durchsuchbar)Installer 5.5.3 (Windows, 64-bit)
Download-Seite (UB Mannheim, immer aktuell)
Deutsche Sprachdatei deu.traineddataBessere Erkennung von Umlauten und deutschen Wörterndeu.traineddata (ca. 1,5 MB)
alle Sprachdateien
LibreOffice (optional)Nur für Word-, Excel-, PowerPoint- und OpenDocument-Dateien: wandelt sie beim Import in PDF um (auch bei der EXE nötig)libreoffice.org – Download-Seite
Pillow, pypdfium2, pypdfBilder und PDF verarbeiten (werden automatisch installiert und beim Start auf den sicheren Mindeststand gebracht: Pillow 12.3.0, pypdfium2 5.13.0, pypdf 6.14.2)Pillow · pypdfium2 · pypdf
pillow-heif (optional)iPhone-Fotos im HEIC-Formatpypi.org/project/pillow-heif

Der direkte Tesseract-Link nennt eine feste Version; sollte er einmal nicht mehr gehen, führt die Download-Seite (UB Mannheim) immer zur aktuellen Fassung.

1. Python (nur bei der Python-Version, nicht bei der EXE)

Python 3.10 oder neuer von python.org installieren, dabei den „py launcher“ aktiviert lassen. Danach genügt ein Doppelklick auf start_babierlos_bl.bat: fehlende Pakete (Pillow, pypdfium2, pypdf) werden automatisch installiert (Internet nötig, einmalig). Ist Python nicht vorhanden, zeigt die Start-Datei die Links an.

2. Tesseract-OCR (für die Texterkennung – wichtig!)

Ohne Tesseract werden Bilder trotzdem zu PDFs, sind aber nicht durchsuchbar (das Dokument wird mit „Keine Texterkennung“ markiert und kann später nachträglich erkannt werden).

  1. Den Windows-Installer (Link in der Tabelle oben) herunterladen und ausführen, Standardordner C:\Program Files\Tesseract-OCR beibehalten.
  2. Im Installer unter „Additional language data“ die Sprache German (deu) ankreuzen. Ohne dieses Sprachpaket werden Umlaute deutlich schlechter erkannt.
  3. Babierlos-BL starten → Einstellungen → Systemprüfung. Dort muss Tesseract mit Status „Vorhanden“ und die Sprache deu stehen.

Deutsche Sprachdatei nachträglich: deu.traineddata (Link oben) herunterladen und in den Ordner tessdata neben der tesseract.exe kopieren (z. B. C:\Program Files\Tesseract-OCR\tessdata; Windows fragt nach Administratorrechten). In der Systemprüfung öffnet die Schaltfläche „Ordner öffnen“ diesen Ordner. Die Datei muss genau deu.traineddata heißen (nicht deu_latf o. ä.). Danach Babierlos-BL neu starten.

Liegt Tesseract woanders, tragen Sie den Pfad zur tesseract.exe in den Einstellungen ein.

3. Optional: iPhone-Fotos (HEIC)

EXE (empfohlen): pillow-heif muss in die EXE eingebaut sein. build_babierlos_bl.bat installiert es ab 0.6.1 selbst mit und baut es ein; am Ende zeigt das Skript „HEIC-Fotos (pillow-heif) eingebaut: JA“. Eine Installation mit pip in PowerShell oder der Eingabeaufforderung wirkt nur auf Python, nicht auf eine schon gebaute EXE – auch nicht mit Administratorrechten (die braucht es nicht). Zeigt die Systemprüfung der EXE „pillow-heif: nicht installiert“, die EXE also einmal neu bauen.

Python-Version: py -m pip install pillow-heif (oder in der Systemprüfung auf „Jetzt installieren“ klicken), danach Babierlos-BL neu starten. Prüfen, ob es in der richtigen Python-Installation gelandet ist: py -c "import pillow_heif; print(pillow_heif.__version__)".

Ohne das Paket erscheint beim Import von HEIC-Fotos eine verständliche Meldung; Ausweg: das Foto vorher als JPG speichern.

4. Optional: LibreOffice (für Word-, Excel- und OpenDocument-Dateien)

Wozu? Nur wenn Sie Dateien wie .docx, .doc, .odt, .xlsx importieren wollen. Das Archiv speichert PDF; LibreOffice wandelt Office-Dateien dafür im Hintergrund um (siehe „Office-Dateien“). Wer nur Scans, Fotos, PDF und E-Mails importiert, braucht es nicht.

  1. Von der Download-Seite die Windows-Version (64-bit) herunterladen und mit den Standardeinstellungen installieren (etwa 350 MB; für diesen Zweck genügt die Grundinstallation, Sprachpakete sind nicht nötig).
  2. Babierlos-BL findet LibreOffice danach selbst – Einstellungen → Systemprüfung zeigt den Eintrag „LibreOffice“ mit Status „Vorhanden“. Ein Neustart ist nicht nötig.

Variante EXE

Mit build_babierlos_bl.bat lässt sich babierlos_bl_v0_6_3.exe bauen (Ausgabe unter %LOCALAPPDATA%\Babierlos-BL-Build\dist). Die EXE enthält Python und die Python-Pakete. Nicht enthalten – und auch bei der EXE separat zu installieren – sind Tesseract-OCR (Texterkennung, Installer, Sprache „German“ mitwählen) und, nur für Word-/Excel-/OpenDocument-Dateien, LibreOffice (Download-Seite). LibreOffice wäre mit mehreren hundert MB zu groß für die EXE. Beide Programme werden an den Standardorten automatisch gefunden; Einstellungen → Systemprüfung und das Willkommensfenster beim ersten Start zeigen, was fehlt, samt Download-Links.

Start & Fenster

Empfohlene (primäre) Startart ist die EXE babierlos_bl_v0_6_3.exe: Doppelklick, kein Python nötig (so wird sie gebaut: siehe „Variante EXE“; Tesseract und LibreOffice bleiben separate Installationen). Alternative ist die Python-Version per start_babierlos_bl.bat. Beide verhalten sich gleich. Babierlos-BL startet einen kleinen lokalen Server und öffnet die Oberfläche in einem eigenen Browserfenster ohne Adressleiste („App-Fenster“). Beim ersten Start fragt ein Dialog nach dem Archivordner (Vorschlag: Babierlos-BL\Archiv im Benutzerordner) – wählen Sie einen Ordner auf einer lokalen, mit BitLocker geschützten Platte.

BrowserVerhalten
AutomatischNutzt Ihren Windows-Standardbrowser, wenn er Chromium, Chrome, Edge oder Firefox ist, sonst der Reihe nach Chromium → Chrome → Firefox → Edge (Edge nur als letzte Möglichkeit).
Chromium / Chrome / EdgeEigenes App-Fenster ohne Adressleiste (Start mit --app).
FirefoxNeues Firefox-Fenster (Firefox kennt keinen App-Modus; die Adressleiste bleibt sichtbar).
Standardbrowser (nur Tab)Öffnet einen normalen Tab im Standardbrowser – der einzige Fall, in dem ein Tab gewollt ist.

Chromium: Gesucht wird in %LOCALAPPDATA%\Chromium\Application\chrome.exe und im Ordner „Program Files“. Liegt Chromium woanders (z. B. portabel), tragen Sie unter Einstellungen → Pfad zum Browser die chrome.exe ein. Ist der gewählte Browser nicht auffindbar, probiert das Programm die übrigen und meldet das beim Start (Hinweis im Fenster, in der Systemprüfung und in babierlos.log) – es öffnet nie stillschweigend einen Tab.

Welcher Browser läuft gerade? Unten in der Statusleiste steht „Fenster: …“ (aus dem Browser selbst ermittelt); die Systemprüfung zeigt zusätzlich, welche Browser mit welchem Pfad gefunden wurden. Eine geänderte Browserwahl gilt erst nach einem Neustart des Programms.

Die Auswahl steht unter Einstellungen → Darstellung & Fenster → Browser. Ein zweiter Start bringt nur das vorhandene Fenster nach vorn. Läuft noch eine ältere Version, beendet der Start sie und wartet (bis zu 25 Sekunden), bis ihr Prozess wirklich weg ist und die Index-Datei freigegeben hat (ab 0.2.19; vorher wurde nur auf das Ende des Servers gewartet). Wird das Fenster geschlossen, beendet sich das Programm nach kurzer Zeit von selbst (abschaltbar; sinnvoll bei laufender Eingangsordner-Überwachung).

Programm-Icon: Das Symbol – drei Dokumentkarten, von einem dunklen Band zusammengehalten (babierlos_bl.ico, Größen 16–256 px, transparent) – wird für die EXE und für Verknüpfungen verwendet; in der Oberfläche erscheint es als Logo oben links. Läuft die Python-Version im App-Fenster des Browsers, kann die Windows-Taskleiste das Symbol des Browsers statt dieses Icons zeigen; verlässlich erscheint das neue Icon bei der EXE und bei einer Verknüpfung, der Sie diese ICO zuweisen.

Tastenkürzel: / Suche · Esc Dialog schließen · Strg+S Speichern im Dokument.

Symbol im Infobereich (ab 0.4.0): Solange Babierlos-BL läuft, steht unter Windows ein Symbol im Infobereich der Taskleiste (unten rechts neben der Uhr; ggf. hinter dem Pfeil „^“). Klick = Fenster öffnen, Rechtsklick = Menü Babierlos-BL öffnen · Handbuch · Beenden. Siehe Mit Windows starten.

Mit Windows starten – Babierlos-BL im Infobereich (ab 0.4.0)

Damit der Eingangsordner (Scanner) auch dann überwacht wird, wenn Sie Babierlos-BL nicht selbst geöffnet haben, kann das Programm beim Anmelden an Windows mitstarten. Es läuft dann ohne Fenster und zeigt nur sein Symbol im Infobereich (unten rechts neben der Uhr). Es ist bewusst kein unsichtbares Hintergrundprogramm: Sie sehen jederzeit, dass es läuft, und können es über das Symbol beenden.

Einschalten

  1. Empfohlen: mit der EXE. Starten Sie Babierlos-BL über babierlos_bl_v0_6_3.exe (siehe „Variante EXE“) und legen Sie die EXE an einen festen Ort (z. B. C:\Programme-BL\Babierlos-BL\), bevor Sie den Haken setzen – Windows merkt sich genau diesen Pfad. Mit der Python-Version geht es ebenso; Windows startet dann pythonw.exe mit start_babierlos_bl.pyw aus dem aktuellen Programmordner.
  2. Einstellungen → Programmstart: Haken „Mit Windows starten“. Das wirkt sofort (nicht erst mit „Speichern“), nur für Ihr Windows-Benutzerkonto und ohne Administratorrechte.
  3. Dabei wird „Programm beenden, wenn das Fenster geschlossen wird“ ausgeschaltet – sonst würde das Schließen des Fensters das Programm (und die Überwachung) beenden. Wer das trotzdem will, kann den Haken unter Darstellung & Fenster wieder setzen; der Abschnitt „Programmstart“ weist dann darauf hin.

Im Alltag

WasWie
Fenster öffnenKlick auf das Symbol – oder Babierlos-BL wie gewohnt starten (ein zweiter Start öffnet nur das Fenster der laufenden Instanz).
Fenster schließenDas Programm läuft weiter. Beim ersten Mal je Sitzung erscheint eine Windows-Benachrichtigung „Babierlos-BL läuft weiter“.
BeendenRechtsklick auf das Symbol → Beenden (läuft gerade ein Import, fragt das Programm nach) – oder im Programm Hilfe → Babierlos-BL beenden. Ein noch offenes Programmfenster bemerkt das nach wenigen Sekunden (spätestens beim nächsten Klick) und schließt sich selbst (ab 0.6.1). Läuft die Oberfläche in einem gewöhnlichen Browser-Tab, darf sie sich nicht selbst schließen; dann steht dort „Babierlos-BL wurde beendet“ – den Tab einfach schließen. Waren am geöffneten Dokument noch Änderungen nicht gespeichert, bleibt das Fenster mit diesem Hinweis offen.
Was gerade läuftMaus auf das Symbol halten: Version und z. B. „Import 2/5“, „Sicherung läuft“ oder „überwacht den Eingangsordner“.
Herunterfahren / AbmeldenWindows meldet das dem Programm; es beendet sich geordnet. Eine Sicherung „beim Beenden“ findet dabei nicht statt – Windows lässt dafür nur wenige Sekunden.
Sicherung bei Dauerbetrieb: Läuft Babierlos-BL ständig, endet es fast nur noch beim Herunterfahren – dann gibt es keine Sicherung „beim Beenden“. Wählen Sie unter Einstellungen → Sicherung zusätzlich „Stündlich“ (oder „Nach jeder Änderung“). Der Abschnitt „Programmstart“ in den Einstellungen zeigt einen Hinweis mit Knopf „„Stündlich“ einschalten“, solange das fehlt.

Nach einem Update

Die EXE trägt die Version im Namen (…_v0_6_3.exe, später z. B. …_v0_6_4.exe). Starten Sie die neue Version einmal von Hand: Zeigt der Eintrag auf eine ältere Version oder auf ein Programm, das es nicht mehr gibt, stellt Babierlos-BL ihn selbst auf die neue um (sichtbar unter Einstellungen → Programmstart und im Protokoll). Einen Eintrag auf eine neuere Version oder auf eine andere, noch vorhandene Fassung lässt es stehen. Typischer Fall: „Mit Windows starten“ wurde mit der Python-Version eingeschaltet, gearbeitet wird jetzt mit der EXE. Dann zeigt der Abschnitt „Programmstart“ zwei Zeilen: Eingetragen (was Windows beim Anmelden startet) und Läuft gerade (das Programm, in dem Sie die Einstellungen sehen). „Das laufende Programm eintragen“ stellt den Autostart auf das laufende Programm um. Liegt die EXE noch im Bau-Ordner (%LOCALAPPDATA%\Babierlos-BL-Build\dist), erscheint ein Hinweis: erst an einen festen Ort kopieren, von dort starten, dann eintragen.

Ausschalten und Entfernen

  • Haken „Mit Windows starten“ entfernen – wirkt sofort.
  • Wollen Sie das Programm löschen, vorher den Haken entfernen. Sonst bleibt ein Eintrag zurück, der ins Leere zeigt; Sie können ihn dann im Task-Manager (Reiter „Autostart“, Eintrag „Babierlos-BL“) deaktivieren.
  • Im Task-Manager deaktiviert? Dann zeigt der Abschnitt „Programmstart“ „In Windows ausgeschaltet“. Erneutes Setzen des Hakens in Babierlos-BL schaltet den Eintrag wieder ein.

Technik (für Neugierige)

Eintrag Babierlos-BL unter HKEY_CURRENT_USER\Software\Microsoft\Windows\CurrentVersion\Run mit dem Startparameter --tray (ohne Fenster starten, nur Symbol). Läuft Babierlos-BL beim Anmelden schon, tut der zweite Start nichts. Ist der Infobereich kurz nach dem Anmelden noch nicht bereit, versucht das Programm es bis zu drei Minuten lang erneut; nach einem Neustart des Explorers legt es das Symbol neu an. Lässt sich gar kein Symbol anlegen, öffnet ein Start mit --tray stattdessen das normale Fenster – das Programm läuft also nie unbemerkt. Das Symbol nutzt die Windows-Schnittstelle direkt, ohne Zusatzpaket.

Neue Versionen – Hinweis auf Updates (ab 0.5.0)

Babierlos-BL sagt Bescheid, wenn es eine neuere Version gibt – im Fenster (Meldung, grüner Eintrag „Neue Version …“ in der Statusleiste und im Menü Hilfe) und, falls es im Infobereich läuft, als Windows-Benachrichtigung am Symbol (ein Klick darauf öffnet das Programm). Jede Version wird einmal gemeldet. Installiert wird nie automatisch – das Programm zeigt nur, was neu ist und wo die Datei liegt.

Woher das Programm von neuen Versionen erfährt

QuelleWie
Update-OrdnerEin Ordner, in dem neue Versionen als Babierlos-BL_vX.Y.Z.zip abgelegt werden – am besten ein synchronisierter Cloud-Ordner (z. B. OneDrive oder Proton Drive), dann wissen Laptop und PC gleichzeitig Bescheid. Geprüft wird nur die oberste Ebene (nicht Archiv\). Die Neuerungen liest das Programm aus dem Abschnitt „Neu in X.Y.Z“ der README.md im ZIP (ersatzweise aus der CHANGELOG.md). Kein Internet nötig.
WebsiteDie Versionsdatei babierlos_bl_version.json auf replikant.net, höchstens einmal täglich abgefragt. Abgerufen wird nur diese kleine Datei; das Programm sendet nichts außer der üblichen Anfrage (Programmname und Version als Kennung). Ausschaltbar.

Geprüft wird kurz nach dem Start und danach alle 6 Stunden, solange das Programm läuft (wichtig bei „Mit Windows starten“), sowie sofort nach dem Speichern geänderter Update-Einstellungen.

Einstellungen → Updates

  • Nach neuen Versionen sehen (Standard: an).
  • Update-Ordner – vollständiger Pfad, z. B. D:\Cloud\Programme\Babierlos-BL. Wird beim Übertragen der Einstellungen mitgenommen.
  • Zusätzlich auf der Website nachsehen (Standard: an) und die Adresse der Versionsdatei (Standard http://replikant.net/babierlos_bl_version.json; nach einem Umzug auf HTTPS hier anpassen).
  • Darunter der Stand beider Quellen („Neueste Datei im Ordner: …“, „Auf der Website liegt (noch) keine Versionsdatei“ …) und „Jetzt prüfen“.

Bei einer neuen Version

Das Fenster „Neue Version verfügbar“ zeigt die installierte und die neue Version, die Neuerungen seit Ihrer Version und die Knöpfe Update-Ordner öffnen bzw. Website öffnen. Aktualisieren wie gewohnt: ZIP entpacken → build_babierlos_bl.bat → neue EXE starten (die laufende alte Version wird dabei beendet). Archiv und Einstellungen bleiben, „Mit Windows starten“ zieht auf die neue EXE um. „Diese Version nicht mehr melden“ unterdrückt nur diese eine Version; unter Einstellungen → Updates lässt sich das mit „Wieder melden“ zurücknehmen.

Versionsdatei für die Website (Format „replikant-version“)

Ein gemeinsames Format für alle Programme des Autors auf replikant.net: je Programm eine Datei <key>_version.json im Wurzelordner der Website (Schlüssel nach dem Namensschema der Website, hier babierlos_bl):

{"format": "replikant-version", "format_version": 1, "programm": "Babierlos-BL", "key": "babierlos_bl",
 "version": "0.5.0", "datum": "2026-10-08", "neu": ["Punkt 1", "Punkt 2"], "seite": "http://replikant.net/…"}

Pflicht sind format, programm und version (2–4 Zahlenteile, z. B. 0.5.0 oder 0.75). Erzeugen: py babierlos_bl.py --versionsdatei <Ordner> schreibt die Datei aus dem Abschnitt „Neu in …“ der README.md (Datum aus der CHANGELOG.md); danach per FTP hochladen. Weil die Website (noch) ohne HTTPS läuft, prüft das Programm die Datei streng: nur Text, Versionsnummer im Format X.Y.Z, „seite“ nur auf demselben Server, alles andere wird verworfen. Eine manipulierte Datei kann also höchstens eine falsche Meldung erzeugen, nie etwas ausführen oder herunterladen.

Solange keine Versionsdatei auf der Website liegt, meldet Einstellungen → Updates „Auf der Website liegt (noch) keine Versionsdatei“ – das ist kein Fehler; der Update-Ordner funktioniert unabhängig davon.

Dokumente importieren

Schaltfläche Importieren (grün). Möglichkeiten:

  • Ziehen & Ablegen von Dateien oder ganzen Ordnern in das Fenster.
  • Dateien wählen (z. B. Handyfotos, die Sie über Kabel/Cloud auf den PC kopiert haben).
  • Ordner importieren per Pfadangabe (z. B. bestehende Dokumentenordner, Unterordner werden mit erfasst). Der Archivordner selbst kann nicht importiert werden.
  • Eingangsordner (Scanner): In den Einstellungen einen Ordner angeben und die Überwachung einschalten. Neue Dateien, die sich einige Sekunden nicht mehr verändern, werden automatisch importiert und nach _verarbeitet (Duplikate: _duplikate, Fehler: _fehler) verschoben. Die Überwachung läuft nur, solange das Programm läuft.

Unterstützt: PDF, JPG, PNG, TIFF, BMP, WebP, GIF, HEIC (mit Zusatzpaket), E-Mail-Dateien .eml (PDF-, Bild-, Office-, CSV- und Text-Anhänge werden importiert; hat die Mail keinen verwertbaren Anhang, wird der Mailtext selbst als durchsuchbare PDF archiviert, ab 0.2.33), Tabellen .csv und .tsv (ab 0.2.33: als PDF in Schreibmaschinenschrift gesetzt, das Original bleibt unverändert) und – mit installiertem LibreOffice – Word-, Excel-, PowerPoint- und OpenDocument-Dateien (.doc .docx .odt .rtf .xls .xlsx .ods .ppt .pptx .odp, siehe „Office-Dateien“). Outlook-.msg wird nicht unterstützt – bitte den Anhang speichern.

Mehrere Dateien zu einem Dokument: Option „Mehrere Bilder und/oder PDF-Dateien zu EINEM Dokument zusammenfassen“ (Reihenfolge = Dateinamen; E-Mails werden nicht zusammengefasst). Bereits archivierte Dokumente fügen Sie über die Mehrfachauswahl zusammen (siehe unten).

Was beim Import passiert

  1. Prüfsumme (SHA-256): Bereits vorhandene Dateien werden als Duplikat übersprungen (auch aus dem Papierkorb erkannt).
  2. Bilder werden zu PDF; gescannte PDF-Seiten ohne Text erhalten per Tesseract eine unsichtbare Textebene. PDF-Seiten mit echtem Text bleiben unverändert. Ab 0.2.41 wird eine schon vorhandene Textebene geprüft: Ist sie Zeichensalat (manche Scanner legen so etwas in die PDF), erkennt Tesseract die Seite neu – siehe Scanner-Text prüfen.
  3. Datum, Titel, Typ, Korrespondent und Tags werden aus dem Text und den Regeln vorgeschlagen. Der Typ kommt seit 0.2.40 zusätzlich aus dem, was das Programm aus Ihren bestätigten Dokumenten gelernt hat – und wird nur gesetzt, wenn es sich sicher ist. Das Datum stammt zuerst aus dem Text; fehlt es dort, gilt bei E-Mails das Datum der Mail, bei Office-Dateien das „zuletzt gespeichert“ aus den Dokumenteigenschaften, dann ein Datum im Dateinamen (ab 0.2.36, z. B. IMG_20220415_0009.pdf), sonst das Änderungsdatum der Datei (auch beim Hochladen per Ziehen & Ablegen oder „Dateien wählen“ – ab 0.2.22; vorher trugen hochgeladene Dateien ohne Datum im Text das heutige Datum). Woher das Datum kommt, steht im Dokument unter „Quelle“.
  4. PDF + JSON + Original werden im Archiv abgelegt. Erst wenn alles geschrieben ist, erscheint das Dokument.

Bilder beim Import aussortieren (ab 0.2.11)

Beim Speichern einer Webseite oder beim Import ganzer Ordner landen oft viele nutzlose Bilder im Archiv (Logos, Symbole, dasselbe Bild in fünf Größen). Babierlos-BL filtert deshalb beim Import von Ordnern, über den Eingangsordner und bei einer Auswahl von mindestens vier Bildern:

  • Webseiten-Ordner („Seite_files“, „Seite_Dateien“ u. ä., die der Browser neben einer gespeicherten Seite anlegt) werden nicht importiert.
  • Größenvarianten (Dateiname endet auf -300x164, -768x419 …): Nur die größte Fassung wird importiert, die kleineren werden übersprungen – aber nur, wenn auch der Bildinhalt übereinstimmt.
  • Zu kleine Bilder (lange Seite unter der Mindestgröße, Standard 400 Pixel) werden übersprungen. 0 schaltet die Prüfung aus.

Übersprungene Dateien erscheinen im Auftrag als „übersprungen“ mit Begründung; im Eingangsordner werden sie nach _uebersprungen verschoben (nichts wird gelöscht). Nicht gefiltert werden per Ziehen & Ablegen oder „Dateien wählen“ hochgeladene Einzelbilder (bis drei Dateien, z. B. ein Foto oder Scan), Importe mit „zu EINEM Dokument zusammenfassen“ und PDF-Dateien. Beim Ordner- und Eingangsordner-Import wirkt der Filter immer: Wer dort bewusst kleine Bilder ablegt, stellt die Mindestgröße in den Einstellungen auf 0. Scans mit unterschiedlichen Dateinamen werden nie als Varianten behandelt. Bei E-Mails werden Bilder im Mailtext (Logos, Tracking-Pixel) nicht als Anhang importiert.

Archiv aufräumen (Bilder) (ab 0.2.11)

Für bereits importierte Bilder: Menü Verwalten → Archiv aufräumen (Bilder) oder Einstellungen → „Vorhandenes Archiv aufräumen“. Mit Analyse starten prüft das Programm alle Bilder-Dokumente (ändert nichts) und zeigt Vorschläge in Gruppen:

GruppeBedeutungVorauswahl
Größenvarianten desselben BildesDateiname mit Größenzusatz und gleicher Bildinhalt; die größte Fassung („behalten“) bleibtja
Dasselbe Bild in anderer Größe (anderer Dateiname)Bildinhalt stimmt überein, Größe unterscheidet sich deutlich. Bewusst streng, damit gleichartige Scans (z. B. Rechnungen eines Absenders) nicht verwechselt werdennein – bitte prüfen
Sehr kleine Bilderlange Seite unter der Mindestgrößeja
Bilder ohne erkennbaren TextTexterkennung fand kaum Text (häufig Fotos). Nur wenn die Texterkennung gelaufen istnein – bitte prüfen

Vorschaubilder lassen sich per Mausfahrt vergrößern. Häkchen entfernen, was bleiben soll, dann „… Dokument(e) in den Papierkorb legen“ und bestätigen. Die Dokumente sind im Papierkorb jederzeit wiederherstellbar; danach wird die Analyse automatisch erneuert. Bei sehr großen Archiven kann die erste Analyse einige Minuten dauern (Bildabdrücke werden zwischengespeichert, spätere Läufe sind schneller).

Quellpfad merken (ab 0.2.12)

Beim Import merkt sich Babierlos-BL, wo die Originaldatei lag (z. B. C:\Scans\Rechnungen\Scan_001.pdf). Der Pfad steht in den Angaben des Dokuments unter „Quelle“ und in der JSON-Datei (originale[].quell_pfad). Er dient nur dem Abgleich unten und ändert nichts an der Datei.

ImportwegQuellpfad
Ordner importierenwird gespeichert
Eingangsordner (Scanner)nur, wenn die Dateien dort bleiben (Einstellung „Nach dem Import verschieben“ aus); werden sie nach _verarbeitet verschoben, verschwindet die Quelle ja planmäßig – dann wird kein Pfad gespeichert
E-Mail (.eml) aus Ordner/EingangPfad der .eml-Datei (Anhänge sind nur Teil der Mail)
Ziehen & Ablegen, „Dateien wählen“kein Pfad – der Browser verrät ihn nicht
Zusammengefügte Dokumentedie Pfade der Ursprungsdokumente wandern mit

Ältere Dokumente (vor 0.2.12) haben keinen Quellpfad. Importieren Sie den Quellordner einfach noch einmal: bereits vorhandene Dateien werden als Duplikat erkannt, der Quellpfad wird dabei nachgetragen (Meldung „Quellpfad nachgetragen“); sonst ändert sich nichts.

Quelle abgleichen – gelöschte Quelldateien (ab 0.2.12, mehrere Quellordner und Vorschau ab 0.2.13)

Wenn Sie in Ihrem Scan- oder Arbeitsordner Dateien gelöscht haben, zeigt dieser Assistent, welche Archivdokumente ihr Original in der Quelle nicht mehr haben. Menü Verwalten → Quelle abgleichen …:

  1. Alle Quellordner angeben – einen je Zeile (jeweils mit Unterordnern), z. B. Ihren Scan-Ordner und Documents\Artikel. Die Liste ist im Programm gespeichert (Einstellungen → „Quellordner“, je Rechner) und wird beim Import eines Ordners automatisch ergänzt; ab 0.2.14 auch um den Eingangsordner (beim Programmstart und wenn Sie ihn ändern). Verarbeitete Scans liegen in dessen Unterordner _verarbeitet und werden mit gelesen – den Scan-Ordner eintragen genügt. Entfernen Sie den Eingangsordner bewusst aus der Liste, bleibt er draußen, solange er unverändert eingestellt ist. Im Assistenten ist die Liste schon eingetragen. Ein Dokument gilt nur dann als fehlend, wenn sein Original in keinem dieser Ordner vorkommt. Fehlt ein Quellordner in der Liste, erscheinen dessen Dokumente fälschlich als „nicht mehr vorhanden“.
  2. Abgleich starten: Das Programm liest alle Ordner und vergleicht den Dateiinhalt (SHA-256) mit den Originalen im Archiv. Umbenennen und Verschieben (auch zwischen den Ordnern) sind daher unkritisch.
  3. Das Ergebnis erscheint in Gruppen, jede Zeile mit Vorschaubild (Bild bzw. erste PDF-Seite), Dateiname und – wenn gespeichert – Quellpfad. Ein Klick auf den Eintrag zeigt das Dokument rechts groß (blättern und zoomen wie im Hauptfenster); der erste Eintrag ist schon geöffnet. Tastatur: Eingabetaste = Vorschau, Leertaste = Häkchen.
  4. Nichts ist vorausgewählt. Mit den Kästchen (oder „Alle“/„Keine“ je Gruppe) wählen Sie aus, was weg soll; das Häkchen ändert die Vorschau nicht.
  5. „… Dokument(e) in den Papierkorb legen“ und bestätigen. Die Dokumente sind im Papierkorb wiederherstellbar; endgültig gelöscht wird hier nie etwas. Danach läuft der Abgleich automatisch erneut.
GruppeBedeutung
Quelle nicht mehr vorhandenWeder eine Datei mit gleichem Inhalt noch eine mit gleichem Namen liegt im Quellordner.
Quelle teilweise vorhandenZusammengefügtes Dokument: ein Teil der Originale liegt noch in der Quelle, ein Teil nicht.
Quelle verändert – bitte prüfenEine Datei mit gleichem Namen liegt noch da, aber mit anderem Inhalt (nachbearbeitet, neu gescannt, vom Scanner wiederverwendeter Name). Meist soll das Dokument bleiben.

Schutzmaßnahmen:

  • Ist einer der Ordner leer oder nicht erreichbar (z. B. USB-Platte oder Netzlaufwerk getrennt), schlägt der Assistent nichts vor, sondern nennt den Ordner. Entweder anschließen oder die Zeile entfernen – dann aber wissen, dass dessen Dokumente als fehlend erscheinen können.
  • Haben auffallend wenige Dokumente (unter 10 %) ihr Original im Ordner, erscheint eine Warnung („richtiger Quellordner?“).
  • Liegt der Archivordner im gewählten Ordner, wird er übergangen (sonst würden die Originale im Archiv die Quelle vortäuschen). Der Archivordner selbst ist als Quelle nicht zulässig.
  • Option „Auch Dokumente ohne oder mit anderem gespeicherten Quellpfad prüfen“ (Standard an): Dann zählt allein der Dateiinhalt – auch für ältere Dokumente. Deshalb müssen alle Quellordner in der Liste stehen; Dokumente aus einem nicht angegebenen Ordner erscheinen sonst als „nicht mehr vorhanden“. Ist die Option aus, werden nur Dokumente geprüft, deren gespeicherter Quellpfad im gewählten Ordner liegt.
  • E-Mail-Anhänge werden nur über den gespeicherten Pfad der .eml geprüft (die Prüfsumme gehört zum Anhang, nicht zur Mail). Ohne gespeicherten Pfad erscheinen sie als „nicht prüfbar“ in der Zusammenfassung. Wurde die .eml umbenannt oder verschoben, gilt sie nur dann als vorhanden, wenn der Name noch irgendwo im Ordner vorkommt.

Tags aus Dateien übernehmen (ab 0.2)

Beim Import liest Babierlos-BL vorhandene Schlagwörter aus der Datei und trägt sie als Tags ein – zusätzlich zu den Tags der Regeln. Das gilt für alle Importwege (Ziehen & Ablegen, Dateien wählen, Ordner, Eingangsordner, E-Mail).

QuelleGelesen werden
Office-Dateien (Word, Excel, OpenDocument …)Feld „Schlüsselwörter“ der Dokumenteigenschaften – gelesen aus der von LibreOffice erzeugten PDF (nur mit installiertem LibreOffice)
PDFFeld „Schlüsselwörter“ (Eigenschaften in Word/Acrobat/Explorer) und XMP-Schlagwörter (dc:subject, pdf:Keywords)
Bilder (JPG, TIFF, PNG, WebP, HEIC …)Windows-„Tags“ (EXIF XPKeywords, im Explorer unter Eigenschaften → Details), IPTC-Schlüsselwörter, XMP-Schlagwörter (z. B. aus Lightroom, Fotos-App)
E-Mail (.eml)Kopfzeilen Keywords, Categories, X-Gmail-Labels (Systemlabels wie Posteingang/Gesendet werden ausgelassen) und Thunderbird-Schlagwörter (X-Mozilla-Keys); sie gelten für alle importierten Anhänge dieser Mail. Zusätzlich zählen die Tags im Anhang selbst.
Ordnernamen (optional)Einstellung „Namen der Unterordner als Tags“: beim Import eines Ordners und beim Eingangsordner werden die Unterordner unterhalb des gewählten Ordners als Tags übernommen (der gewählte Ordner selbst nicht). Beim Hochladen per Ziehen & Ablegen ist der Ordnerpfad nicht bekannt.
  • Trennzeichen in Schlüsselwortfeldern: Semikolon, Komma, senkrechter Strich, Zeilenumbruch. Reine Leerzeichen trennen nicht („Rechnung Strom 2026“ bleibt ein Tag).
  • Tags werden bereinigt: höchstens 40 Zeichen, doppelte (auch in anderer Schreibweise) entfallen, höchstens 30 je Dokument.
  • Im Auftragsprotokoll steht hinter jedem importierten Dokument, welche Tags es erhalten hat.
  • Bereits importierte Dokumente: Schaltfläche „Tags aus Datei“ im Dokument bzw. in der Auswahlleiste liest die Originaldatei erneut und ergänzt fehlende Tags (es wird nie etwas entfernt). Bei E-Mail-Anhängen stehen dabei nur die Tags des Anhangs selbst zur Verfügung, nicht die der Mail.
  • Meldung „Keine neuen Tags gefunden“: Dann steht in der Originaldatei nichts in den gelesenen Feldern (oder alles ist schon als Tag vorhanden). Mit „Datei-Metadaten“ (oder „Warum?“ in der Meldung) sehen Sie, welche Felder die Datei enthält. Tags, die nur im Dateisystem oder in einer anderen Anwendung gespeichert sind (z. B. Explorer-Tags bei Dateien ohne Metadaten-Unterstützung, Verschlagwortung in einem Fotoprogramm-Katalog), liegen nicht in der Datei und können nicht gelesen werden. Zusätzlich gelesen werden PNG-Textfelder „Keywords“/„Subject“, Lightroom-Hierarchien (letztes Glied), Windows-Fotos- und digiKam-Schlagwörter.
  • Vorschläge aus dem Text: Enthält die Datei keine Tags (typisch bei Web-Ausdrücken und Web-Bildern), hilft im Dokument die Schaltfläche „Vorschläge aus dem Text“ (unter dem Tag-Feld). Sie zeigt grün schon im Archiv verwendete Tags, die im Text vorkommen, und violett häufige Hauptwörter. Ein Klick übernimmt den Vorschlag ins Tag-Feld; gespeichert wird erst mit „Speichern“. Die Vorschläge beruhen nur auf Worthäufigkeit: Namen, Verben oder Überschriftenwörter sind gelegentlich dabei und einfach zu ignorieren. Ohne erkannten Text (keine Texterkennung) gibt es keine Vorschläge.
  • Ausschalten: Einstellungen → „Tags beim Import aus der Datei übernehmen“.

Der Fortschritt steht unter Aufträge. Import läuft im Hintergrund; Sie können weiterarbeiten. Fehler stehen mit Klartext in der Auftragsliste.

Scanner-Text prüfen – Zeichensalat erkennen und neu erkennen (ab 0.2.41)

Worum es geht: Manche Scanner-Programme (beobachtet: EPSON Scan und Canon IJ Scan Utility) machen selbst eine Texterkennung und legen das Ergebnis unsichtbar in die PDF. Ist diese Textebene schlecht – bei Schwarzweiß-Scans mit 200 dpi oft reiner Zeichensalat wie „Sesa{1it-Bruttö fio,Ü5 €ur{“ statt „Gesamt-Brutto 40,95 EUR“ –, lief Tesseract bis 0.2.40 trotzdem nicht, weil die PDF ja schon „Text“ enthielt. Folge: keine Treffer bei der Suche, kein Betragsvorschlag, ein Titel aus Strichcode-Resten.

Was das Programm beim Import prüft

  • Für jede Seite wird die Textqualität bestimmt: der Anteil der Zeichen, die zu echten Wörtern, Zahlen, Beträgen, Daten oder Web-/Mail-Adressen gehören (ohne Wörterbuch, sprachunabhängig). Geeicht am echten Archiv: unbrauchbare Scanner-Texte lagen bei 15–30 %, Tesseract-Ergebnisse fast immer über 90 % (Mittelwert 97 %).
  • Unter 50 % gilt die Textebene als unbrauchbar: Tesseract erkennt die Seite neu.
  • Gescannte Seiten (ein Bild bedeckt die ganze Seite) mit mäßigem Text (unter 85 %) werden ebenfalls neu erkannt – der neue Text ersetzt den alten aber nur, wenn er deutlich besser ist. PDFs mit „echtem“ Text (z. B. aus Word, von Webseiten) bleiben unverändert.
  • Liest sich auch das Ergebnis von Tesseract schlecht, prüft das Programm, ob das Blatt verkehrt herum oder quer eingelegt war (Ausrichtungserkennung von Tesseract, sonst durch Ausprobieren von 180°, 90° und 270°). Eine Drehung wird nur übernommen, wenn der Text damit deutlich besser wird; die Seite steht dann im Archiv richtig herum.
  • Gescannte Seiten werden nicht über ihre eigene Auflösung hinaus hochgerechnet (ein 200-dpi-Schwarzweiß-Scan wird mit 200 dpi erkannt – hochgerechnet wurde aus „40,95“ sonst leicht „4 0,95“).
  • Was passiert ist, steht als Meldung im Auftrag („Die mitgelieferte Textebene war unbrauchbar (Seite 1, Textqualität 15 %) – mit Tesseract neu erkannt.“). Die Originaldatei bleibt immer unverändert.
  • Ohne Tesseract bleibt der Scanner-Text, wie er ist; Zeilen ohne echte Wörter werden aber nicht mehr als Titel verwendet.

Ältere Dokumente finden: Verwalten → Schlechte Texterkennung finden

Das Fenster prüft alle Dokumente, deren Text aus der Datei stammt (bei ihnen lief beim Import keine Texterkennung), und listet sie mit Textqualität und Bewertung: Zeichensalat (vorausgewählt) und mäßig (Scan) (auf Wunsch anhaken). Office-, Text- und E-Mail-Dokumente werden nicht aufgeführt – ihr Text kommt direkt aus der Datei. „Ausgewählte neu erkennen“ plant die Neu-Erkennung als Auftrag ein (etwa 3–8 Sekunden je Seite, abbrechbar). Ein Klick auf den Titel öffnet das Dokument.

Im Dokument selbst erscheint bei Zeichensalat ein roter Hinweis mit dem Knopf „Text neu erkennen“.

Empfehlung für den Scanner: In EPSON Scan bzw. der Scanner-Software die eigene Texterkennung („durchsuchbare PDF“, „OCR“) abschalten – Babierlos-BL erkennt selbst – und möglichst mit 300 dpi Graustufen statt 200 dpi Schwarzweiß scannen. Das spart Zeit beim Import und verbessert die Erkennung.

Office-Dateien (Word, Excel, OpenDocument …) – ab 0.2.21

Babierlos-BL importiert auch Word-, Excel-, PowerPoint- und OpenDocument-Dateien: .doc, .docx, .odt, .rtf, .xls, .xlsx, .ods, .ppt, .pptx, .odp. Ziehen & Ablegen, „Dateien wählen“, Ordnerimport, Eingangsordner und E-Mail-Anhänge funktionieren wie bei PDF.

Voraussetzung: LibreOffice. Das Archiv besteht aus durchsuchbaren PDF-Dateien. Eine Office-Datei muss dafür zuerst in PDF umgewandelt werden – das kann Python nicht selbst, deshalb übernimmt LibreOffice (kostenlos, freie Software) diesen Schritt. Es muss auf dem PC installiert sein: Download libreoffice.org (Windows, 64-bit, Standardeinstellungen, etwa 350 MB). Das gilt für die Python-Version und für die EXE – LibreOffice ist in der EXE nicht enthalten. PDF, Bilder und E-Mails brauchen LibreOffice nicht.

Was passiert beim Import

  1. Babierlos-BL sucht LibreOffice selbst (Programme-Ordner, %LOCALAPPDATA%\Programs, Ordner LibreOffice neben dem Programm, Suchpfad, oder der Pfad aus Einstellungen → Office-Dateien). Es wird bei jedem Import neu gesucht – nach der Installation genügt es, den Import zu wiederholen, ein Neustart ist nicht nötig.
  2. LibreOffice wandelt die Datei im Hintergrund ohne Fenster in PDF um (in der Auftragsliste: „wird mit LibreOffice in PDF umgewandelt“). Das dauert meist einige Sekunden je Datei, beim allerersten Mal länger. Mehrere Dateien werden nacheinander umgewandelt.
  3. Die erzeugte PDF kommt ins Archiv. Der Text steht direkt im Dokument (kein OCR nötig), die Volltextsuche findet ihn sofort. Titel, Datum und Korrespondent werden wie bei jeder PDF vorgeschlagen; Schlüsselwörter aus den Dokumenteigenschaften werden – bei eingeschalteter Tag-Übernahme – als Tags übernommen.
  4. Die Original-Datei bleibt unverändert als Original im Archiv (z. B. …original.docx) und lässt sich über „Original öffnen“ in Word/LibreOffice öffnen. Abgelegt werden also PDF (zum Lesen und Suchen) und die bearbeitbare Quelle.
  5. Wie bei allen Importen gilt: Dieselbe Datei wird als Duplikat erkannt, neue Dokumente erscheinen – je nach Einstellung – im Posteingang.

Datum von Office-Dokumenten (ab 0.2.22)

Reihenfolge: Datum im Text → Dokumenteigenschaften („zuletzt gespeichert“, sonst „erstellt“; Quelle „Dokumenteigenschaften“; gelesen bei .docx .xlsx .pptx .odt .ods .odp .rtf und ab 0.2.24 auch bei .doc .xls .ppt) → Datum im Dateinamen (ab 0.2.36; Quelle „Datum im Dateinamen“) → Änderungsdatum der Datei.

Datum im Dateinamen (ab 0.2.36): Kamera-, Scanner- und Handy-Dateien tragen das Aufnahmedatum im Namen, z. B. IMG_20220415_0009.pdf, PXL_20220415_123456789.jpg, Scan_2022-04-15.pdf, IMG-20220415-WA0001.jpg oder Rechnung 15.04.2022.pdf. Erkannt werden nur eindeutige Formen: JJJJMMTT, JJJJ-MM-TT, JJJJ_MM_TT, JJJJ.MM.TT (mit gleichem Trennzeichen) und TT.MM.JJJJ (vierstelliges Jahr). Ungültige Daten (z. B. 20231301), Jahre vor 1990 und Daten, die mehr als 7 Tage in der Zukunft liegen, werden ignoriert. Das gilt für neue Importe; bereits archivierte Dokumente bleiben unverändert. Die Quelle „manuell eingegeben“ erscheint seit 0.2.36 nur noch, wenn du das Datum wirklich geändert hast (vorher nach jedem Speichern).

Automatische Datumsfelder (ab 0.2.23 im PDF festgeschrieben): Briefe mit einem Datumsfeld („Einfügen → Datum“, nicht als fester Text) würden beim Umwandeln das heutige Datum zeigen. Vor der Umwandlung werden solche Felder deshalb in einer Arbeitskopie durch den in der Datei gespeicherten Wert ersetzt (Datums- und Zeitfelder in Text, Kopf-/Fußzeilen; in Tabellen die Formeln HEUTE()/JETZT()). Das Original im Archiv bleibt unverändert. Wirksam bei .odt .ods .odp .docx .xlsx .pptx .rtf und ab 0.2.24 auch bei den alten Binärformaten:
  • .doc (Word 97–2003 und – ab 0.2.26 – Word 6.0/95): Datums- und Zeitfelder im Text, in Kopf-/Fußzeilen, Fußnoten, Endnoten, Kommentaren und – ab 0.2.25 – in Textfeldern (z. B. Briefkopf neben dem Logo, auch in der Kopfzeile) zeigen den in der Datei gespeicherten Wert. Andere Felder (z. B. Seitenzahl) bleiben unberührt. Felder ohne gespeicherten Wert bleiben wie bisher.
  • .xls (Excel 97–2003): nur Zellen, deren Formel genau =HEUTE() ist. =HEUTE()+30, JETZT() und Ähnliches rechnet LibreOffice weiterhin mit dem heutigen Datum.
  • .ppt: nicht möglich – PowerPoint speichert bei „Datum automatisch aktualisieren“ gar kein Datum, nur die Anweisung „heute anzeigen“.
Wo das nicht greift: in Word/Excel das Feld in festen Text umwandeln oder selbst als PDF speichern. Zur Ursachensuche bei einer .doc gibt es das Werkzeug werkzeuge\doc_diagnose.bat (Datei darauf ziehen): Es zeigt nur den Aufbau – Word-Version und welche Feldtypen wo stehen –, keinen Text und keinen Dateinamen, und verändert die Datei nicht. Die Ausgabe kann man gefahrlos weitergeben. Als zweite Sicherung gilt weiter: Steht im Text das heutige Datum, die Datei wurde aber früher gespeichert, zählt das Speicherdatum (Hinweis im Importergebnis). Wurde ein Dokument heute geschrieben und heute importiert, bleibt das Datum aus dem Text. Bereits importierte Dokumente behalten ihr altes PDF – dafür Dokument endgültig löschen (Papierkorb) und die Datei erneut importieren.

Wichtig zu wissen

  • Ohne LibreOffice wird die Datei nicht still übersprungen, sondern mit der Meldung „LibreOffice nicht gefunden …“ samt Download-Adresse als Fehler gemeldet; im Importfenster steht dazu schon vorher ein Hinweis mit Schaltfläche „LibreOffice herunterladen“. Beim Eingangsordner landen solche Dateien in _fehler – nach der Installation von dort zurück in den Eingangsordner legen.
  • Das PDF sieht aus wie LibreOffice die Datei darstellt. Fehlen auf dem PC die Schriften eines Word-Dokuments, kann sich der Seitenumbruch ändern; sehr aufwendig gestaltete Dokumente können abweichen. Wo es auf das exakte Aussehen ankommt, in Word „Als PDF speichern“ und die PDF importieren.
  • Makros werden nicht ausgeführt (und Makro-Formate wie .docm/.xlsm werden gar nicht importiert). Die Umwandlung nutzt ein eigenes LibreOffice-Profil (Ordner libreoffice-profil im Datenordner); ein gleichzeitig geöffnetes LibreOffice oder Word stört nicht.
  • Kennwortgeschützte oder beschädigte Dateien werden mit einer Meldung abgewiesen. Hängt LibreOffice länger als drei Minuten, wird es beendet und die Datei als Fehler gemeldet.
  • Tabellen (Excel) werden so gedruckt, wie sie LibreOffice paginiert – große Tabellen ergeben viele Seiten. Für Zahlenauswertung bleibt die Original-Datei maßgeblich.
  • Mehrere Office-Dateien lassen sich beim Import nicht zu einem Dokument zusammenfassen (aus Bildern und PDF schon).
  • E-Mails: Office-Anhänge werden jetzt mit importiert (vorher ignoriert); fehlt LibreOffice, erscheint für diesen Anhang ein Fehler, die übrigen Anhänge werden trotzdem importiert.
Stand von LibreOffice: Einstellungen → Systemprüfung (Eintrag „LibreOffice“, mit Pfad). Dort und im Willkommensfenster beim ersten Start steht auch der Download-Link; liegt LibreOffice portabel oder an ungewöhnlicher Stelle, den Pfad zu soffice.exe unter Einstellungen → Office-Dateien eintragen.

Suchen & Ordnen

  • Volltextsuche oben: mehrere Wörter = alle müssen vorkommen. Groß-/Kleinschreibung und Akzente/Umlautpunkte werden ignoriert („müller“ findet auch „Muller“ und „MÜLLER“; „mueller“ ist dagegen eine andere Schreibweise). Das letzte Wort wird als Wortanfang gesucht („rech“ findet „Rechnung“). Treffer werden im Ausschnitt markiert.
  • Papierkorb mitsuchen (ab 0.2.39): Normalerweise findet die Suche nur aktive Dokumente. Sobald Sie etwas in das Suchfeld getippt haben, erscheint über der Liste der Haken „Papierkorb mitsuchen“ (er lässt sich auch im Menü Ansicht setzen und bleibt auf diesem Rechner gespeichert). Treffer aus dem Papierkorb sind rot gekennzeichnet (Chip „Papierkorb“, rötliche Zeile) und werden im Zähler genannt – „4 Dokumente (davon 2 im Papierkorb)“. Ein Klick öffnet das Dokument; dort gibt es Wiederherstellen. Der Haken gilt nur bei einem Suchbegriff und nicht in den Ansichten Papierkorb, Posteingang, Neu importiert, Fällig und „Ohne Text“; er gehört auch nicht zu gespeicherten Ansichten. Betragssummen zählen Papierkorb-Dokumente weiterhin nicht mit. In einer Liste mit Papierkorb-Treffern wirken Wiederherstellen und In den Papierkorb in der Aktionsleiste jeweils nur auf die passenden Dokumente (die Zahl steht im Knopf); Zusammenfügen, Erledigt und Zu prüfen fehlen, solange ein Papierkorb-Dokument angehakt ist. Findet die Suche ohne Haken nichts, weist die Liste darauf hin, dass der Papierkorb nicht durchsucht wurde.
  • Seitenleiste: Posteingang (noch nicht durchgesehene Neuzugänge, ab 0.2.20, siehe „Posteingang“), Neu importiert (ab 0.2.35: alles, was in den letzten 7 Tagen importiert wurde, zuletzt importierte zuerst – praktisch, weil ein neues Dokument sonst nach seinem Dokumentdatum einsortiert wird und bei einem alten Datum weit unten steht), Filter nach Jahr, Korrespondent, Dokumenttyp, Tag; Papierkorb. Filter lassen sich kombinieren und über die Chips über der Liste wieder lösen.
  • Sortierung: Datum, Importdatum, Korrespondent, Relevanz (bei Suche).
  • Mehrfachauswahl (Kästchen links in der Liste; das Kästchen in der Kopfzeile wählt alle geladenen): Sobald mindestens ein Dokument angehakt ist, erscheint über der Liste eine Aktionsleiste: Tags hinzufügen/entfernen, Korrespondent oder Typ setzen, Zusammenfügen (ab zwei Dokumenten), Regeln erneut anwenden, Tags aus Datei, Texterkennung nachholen, Erledigt / Zu prüfen (Posteingang), in den Papierkorb. Im Papierkorb stehen stattdessen Wiederherstellen und – ab 0.2.23 – Endgültig löschen (mit Rückfrage; PDF und Originale werden unwiderruflich entfernt, nicht rückgängig zu machen).
  • Zusammenfügen: Die angehakten Dokumente werden in der gewählten Reihenfolge (▲▼ im Fenster) zu einem neuen Dokument. Falsche Reihenfolge erwischt? Rückgängig und neu zusammenfügen – oder im neuen Dokument „Seiten bearbeiten“. Datum, Korrespondent und Typ kommen vom ersten Dokument, Tags aus allen, die Notiz nennt die Herkunft, alle Originaldateien bleiben erhalten. Die Ursprungsdokumente kommen auf Wunsch in den Papierkorb und lassen sich dort wiederherstellen.
  • Ansicht (Menü oben): „Standard“ (Vorschau über den Angaben) oder „Vier Spalten“ (Filter | Liste | Vorschau | Angaben). Die Filterleiste lässt sich ausblenden (dann drei Spalten), die Liste ausblenden (nur Dokument), und „Fenstergrößen zurücksetzen“ stellt die Standardbreiten wieder her.
  • Zu groß, zu unübersichtlich? (ab 0.2.19) Im Menü Ansicht: Liste: kompakt setzt Titel und Chips (Korrespondent, Typ, Tags, Felder) eng in eine Zeile bzw. zwei, mit kleinerer Schrift und höchstens zwei Tags je Zeile – es passen etwa doppelt so viele Dokumente auf den Bildschirm. Tags in der Liste anzeigen (ab 0.2.32, Standard: an) blendet die orangefarbenen Tag-Chips in der Dokumentliste aus – die Liste wird ruhiger und zeigt mehr Dokumente; die Tags bleiben im Dokument, in der Suche und in der Filterleiste links erhalten (Korrespondent, Typ und Felder bleiben in der Liste sichtbar). Größe 80 / 90 / 100 / 110 / 125 % vergrößert oder verkleinert die gesamte Oberfläche und wird je Rechner gespeichert (der Browser-Zoom per Strg+− bleibt über einen Neustart nicht sicher erhalten, weil sich die lokale Adresse bei jedem Start ändert – deshalb gibt es die Einstellung hier). Empfehlung bei hoher Windows-Skalierung (z. B. 175 %): erst „Größe 80 %“ oder „90 %“, dann bei Bedarf „Liste: kompakt“.
  • Vier Spalten: Zwischen Vorschau und Angaben gibt es einen Trenner – ziehen (Doppelklick = Standard), damit die Angaben mehr Platz bekommen. Die Breite wird je Rechner gespeichert. Beim Ziehen bleibt die Maus jetzt auch über der PDF-Vorschau erhalten (vorher konnte ein Trenner dort hängen bleiben).

Dokument bearbeiten

Klick auf ein Dokument öffnet rechts Vorschau (PDF) und Angaben. Änderungen an Datum, Korrespondent oder Typ benennen die Dateien im Archiv automatisch um (Datum_Korrespondent_Typ_ID.pdf). Die ID (sechs Zeichen) bleibt immer gleich und macht jeden Namen eindeutig.

  • Im System-Viewer öffnet die PDF im Standardprogramm von Windows (z. B. Adobe Reader). PDF im Browser zeigt sie in einem Browser-Tab. Original öffnen öffnet die ursprüngliche Datei (z. B. das Foto) im Standardprogramm, Original speichern lädt sie herunter.
  • Größe ändern: Die Trennlinien zwischen Seitenleiste, Liste und Dokumentbereich sowie unter der PDF-Vorschau lassen sich mit der Maus ziehen (oder mit den Pfeiltasten, wenn die Linie ausgewählt ist). Doppelklick auf eine Linie stellt die Standardgröße wieder her. Vorschau groß (Schaltfläche oben im Dokumentbereich) blendet Seitenleiste und Liste aus; Esc oder „Liste einblenden“ bringt sie zurück. Die Größen werden gespeichert.
  • Texterkennung nachholen bzw. Texterkennung neu (ab 0.2.41 immer da, wenn Tesseract installiert ist und das Original ein Scan, Bild oder eine PDF ist): erkennt den Text mit Tesseract neu. Eine Textebene, die schon in der PDF steckt, wird dabei nicht mehr einfach übernommen; sie bleibt nur auf Seiten, auf denen sie nachweislich besser ist als das neue Ergebnis (Meldung im Auftrag). Ihre Angaben (Titel, Typ, Tags, Felder) bleiben; ein automatisch vergebener Titel aus Zeichensalat wird durch einen Titel aus dem neuen Text ersetzt. Achtung bei PDFs mit „echtem“ Text (z. B. aus Word): Danach besteht die Seite aus einem Bild mit unsichtbarem Text – das Original bleibt aber unverändert im Archiv. Die PDF wird dabei aus den Originalen neu aufgebaut – bei zusammengefügten Dokumenten aus allen Originalen (bis 0.2.14 wurde bei mehreren PDF-Originalen nur das erste verwendet) und in der eigenen Seitenreihenfolge.
  • Seiten bearbeiten (ab 0.2.15, Drehen/Entfernen/Teilen ab 0.2.16): zeigt alle Seiten als Vorschaubilder.
    • Ordnen: Seiten mit der Maus ziehen oder ◀ ▶ bzw. Pfeiltasten; „Umkehren“ dreht die Reihenfolge um (z. B. falsch herum gescannter Stapel).
    • Drehen: ↻ dreht eine Seite um 90° im Uhrzeigersinn (Taste R), „Alle drehen“ alle Seiten.
    • Entfernen: ✕ markiert eine Seite (z. B. leere Rückseite) zum Entfernen (Taste Entf); ↺ nimmt das zurück. Mindestens eine Seite bleibt – ganze Dokumente kommen in den Papierkorb.
    • Teilen: ✂ vor einer Seite: ab dieser Seite entsteht ein neues Dokument (z. B. mehrere Briefe in einem Scan). Die neuen Teile erhalten Datum, Korrespondent, Typ und Tags des Ausgangsdokuments, den Titel „… (Teil 2)“ und in der Notiz die Herkunft.
    Speichern schreibt die Änderungen in die PDF im Archiv (bei Entfernen/Teilen mit Rückfrage); Rückgängig stellt den vorherigen Stand wieder her (geteilte Teile werden dann entfernt). Die Originaldateien bleiben immer unverändert; Auswahl, Reihenfolge und Drehung werden vermerkt (seitenfolge, seitendrehung, seiten_natur in der JSON-Datei) und bei einer späteren Texterkennung und beim Zusammenfügen beibehalten. Der erkannte Text folgt der Auswahl, d. h. entfernte Seiten werden nicht mehr gefunden. Bitte Seiten nicht mit einem externen PDF-Programm bearbeiten – „Texterkennung nachholen“ würde das überschreiben.
  • Dokumenttyp: Der Pfeil ▾ zeigt zuerst die Typen, die Sie am häufigsten vergeben haben (nach Anzahl der Dokumente), danach die übrigen Standardtypen (ab 0.2.15).
  • Korrespondent ist der Absender oder die Gegenpartei des Dokuments, z. B. „Stadtwerke“, „Finanzamt“ oder „Dr. Müller“. Er dient zum Filtern und steckt im Dateinamen. Der Pfeil ▾ im Feld zeigt immer alle bekannten Einträge (dasselbe gilt für den Dokumenttyp), auch wenn das Feld schon ausgefüllt ist. Ist das Feld leer, stehen darunter erkannte Namen zum Anklicken; ein beim Import erkannter Korrespondent trägt die Marke „automatisch – bitte prüfen“ (ab 0.2.43, siehe Korrespondent erkennen).
  • Regeln anwenden: füllt leere Felder nach den aktuellen Regeln, dem Gelernten (Typ) und ab 0.2.43 nach Namen/Kennzeichen (Korrespondent); Tags aus Regeln kommen hinzu. Vorhandener Typ oder Korrespondent wird nie überschrieben.
  • Der erkannte Text steht unter „Erkannter Text“ und ist die Grundlage der Suche.
Wichtig: Die erzeugte PDF ist eine durchsuchbare PDF (Bild + unsichtbarer Text), kein zertifiziertes PDF/A und keine revisionssichere Archivierung im Sinne der GoBD.

Posteingang – was noch zu prüfen ist (ab 0.2.20)

Der Posteingang zeigt nur die Dokumente, die Sie noch nicht durchgesehen haben – nicht das ganze Archiv. In der Seitenleiste steht ganz oben Posteingang mit der Anzahl; in der Liste kennzeichnet ein kleines Eingangs-Symbol jedes Dokument, das noch zu prüfen ist.

  • Was kommt hinein? Jedes neu importierte Dokument, dessen Herkunft unter Einstellungen → Posteingang angehakt ist. Standard: Scanner (Eingangsordner), Fotos, Dateien und E-Mails – nicht der Import ganzer Ordner, damit ein Altbestand den Posteingang nicht überflutet. Die Herkunft eines Imports wählen Sie im Import-Fenster („Herkunft“). Ein zusammengefügtes Dokument ist zu prüfen, wenn mindestens eines der Ursprungsdokumente es war; beim Teilen erben die Teile den Status.
  • Bereits vorhandene Dokumente (alle aus Versionen vor 0.2.20) gelten als erledigt: Der Posteingang beginnt leer, an Ihrem Archiv wird nichts geändert. Ein älteres Dokument legen Sie bei Bedarf über Auswahl → „Zu prüfen“ in den Posteingang.
  • Eigener Status statt „ohne Tags“: Der Posteingang richtet sich nicht danach, ob ein Dokument Tags hat. So bleibt ein Dokument im Posteingang, auch wenn Regeln oder Datei-Metadaten schon Tags gesetzt haben, und ein bewusst ungetaggtes Dokument hängt nicht für immer dort fest.
  • Erledigen: Im Dokument steht oben rechts der Haken „Zu prüfen“. Sobald Sie etwas ändern (Titel, Tags, Typ …), nimmt sich der Haken von selbst weg; mit Speichern ist das Dokument erledigt. Wollen Sie es trotz Änderung im Posteingang behalten, setzen Sie den Haken selbst wieder. „Erledigt & weiter“ markiert ein Dokument ohne weitere Änderung als erledigt. Im Posteingang verschwindet es dann aus der Liste und das nächste Dokument öffnet sich – so arbeiten Sie den Stapel ohne zusätzliche Klicks ab. „Regeln anwenden“ und „Tags aus Datei“ ändern den Status nicht.
  • Mehrere auf einmal: Dokumente ankreuzen → in der Aktionsleiste Erledigt (außerhalb des Posteingangs auch Zu prüfen).
  • Kombinieren: Die Volltextsuche und die Feldfilter wirken auch im Posteingang. Ein Klick auf Jahr, Korrespondent, Typ oder Tag verlässt ihn. Als Ansicht gespeichert, merkt sich der Posteingang auch die Sortierung (z. B. „Zuletzt importiert“).
  • Rückgängig: Alle Statusänderungen (Speichern, Erledigt, Zu prüfen) lassen sich mit „Rückgängig“ zurücknehmen.

Regeln

Unter Regeln legen Sie fest, wie Typ, Korrespondent und Tags automatisch vorgeschlagen werden. Eine Regel hat Suchbegriffe (Komma-getrennt), die am Wortanfang im erkannten Text gesucht werden, sowie Ergebnisse (Korrespondent, Typ, Tags). Optional lässt sich ein regulärer Ausdruck (RegEx) angeben; die Regel passt, wenn ein Suchbegriff oder das Muster trifft. Die erste passende Regel bestimmt Typ und Korrespondent (Reihenfolge = Priorität); Tags aller passenden Regeln werden ergänzt (und mit den aus der Datei gelesenen Tags vereinigt). Fehlerhafte Regeln werden beim Speichern abgelehnt – mit einer Meldung auf Deutsch, die auch die Stelle im Muster nennt.

Regeln wirken beim Import und über die Sammelaktion „Regeln anwenden“; vorhandene Angaben werden nie überschrieben.

Ab 0.2.40 gilt für den Typ: Ein Typ aus einer Regel wird nur noch gesetzt, wenn das Gelernte ihn bestätigt (sobald genug von Ihnen bestätigte Dokumente vorliegen). Eine Regel, die den Typ oft falsch setzt, wird dadurch wirkungslos; Sie können sie dann bedenkenlos löschen. Korrespondent und Tags der Regeln gelten unverändert.

Hilfe zu RegEx im Regeldialog (ab 0.2.31)

  • Hinweiszeile unter der Tabelle (immer sichtbar) mit einer Kurzerklärung und dem Link zu „RegEx kurz erklärt“; dieselbe Erklärung steht als Tooltip am RegEx-Feld und an der Spaltenüberschrift „RegEx ⓘ“.
  • Beispiele zum Anklicken (Datum, Betrag, Rechnungsnummer, Kundennummer, IBAN, E-Mail-Adresse): Ein Klick trägt das Muster in das RegEx-Feld der markierten Regel ein (die Zeile, in die Sie zuletzt geklickt haben; gibt es keine, wird eine neue Regel angelegt). Der Mauszeiger über dem Beispiel zeigt Muster und Erklärung.
  • Testfeld: Beispieltext einfügen (z. B. aus einem Dokument kopiert) – Treffer werden sofort gelb markiert und gezählt. Ein fehlerhaftes Muster wird sofort auf Deutsch gemeldet. Getestet wird das Muster der markierten Regel mit denselben Einstellungen wie beim Import.
  • „Auf mein Archiv anwenden“: zählt, auf wie viele Dokumente die markierte Regel (Suchbegriffe und RegEx) passt, mit bis zu fünf Beispieltiteln. Es wird nichts verändert. Geprüft wird der erkannte Text der nicht gelöschten Dokumente; der Dateiname fließt – anders als beim Import – nicht ein, die Zahl kann daher etwas niedriger sein. Nach 8 Sekunden bricht die Zählung ab und meldet, dass nur ein Teil geprüft wurde.

Dokumenttyp lernen – automatisch, aber nur bei Sicherheit (ab 0.2.40)

Wozu: Regeln setzen den Typ blind: Taucht das Wort „Rechnung“ irgendwo im Text auf, wird das Dokument zur Rechnung – auch wenn es ein Vertrag ist, in dem von einer Rechnung die Rede ist. Eine Messung an einem echten Archiv ergab, dass rund 40 % der Regel-Typen falsch waren. Seit 0.2.40 lernt das Programm deshalb aus den Dokumenten, deren Typ Sie bestätigt haben, welche Wörter zu welchem Typ gehören, und setzt den Typ nur, wenn es sich sicher ist.

Was als „bestätigt“ zählt

  • Ein Typ, den Sie selbst gesetzt haben (im Dokument, über die Sammelaktion „Typ“ oder von Hand beim Import), oder den Sie beim Speichern eines Dokuments stehen gelassen haben. Das Dokument muss nach dem Import von Ihnen gespeichert worden sein; es braucht erkannten Text (mindestens 40 Zeichen) und darf nicht im Papierkorb liegen.
  • Nicht bestätigt ist ein vom Programm automatisch gesetzter Typ (aus den Regeln oder aus dem Gelernten). Solche Dokumente tragen intern die Marke „Typ automatisch“, die erst entfällt, wenn Sie das Dokument speichern oder den Typ setzen. Ein Speichern aus anderem Anlass über die Sammelaktionen (Tags, Papierkorb, Zusammenfügen) oder das Umbenennen eines Typs unter Verwalten ändert daran nichts. So lernt das Programm nie aus seinen eigenen Entscheidungen.
  • Ihr bisheriger Bestand zählt, soweit Sie die Dokumente nach dem Import gespeichert haben (er trägt keine Marke).

Die Sicherheitsschwelle

Für jede Entscheidung berechnet das Programm, wie klar der beste Typ vor dem zweitbesten liegt (Abstand). Ab welchem Abstand der Typ automatisch gesetzt wird, bestimmt das Programm selbst: Es prüft jedes Ihrer bestätigten Dokumente mit einem Modell, das dieses Dokument nie gesehen hat (zehnfache Kreuzvalidierung), und wählt die niedrigste Schwelle, bei der in dieser Prüfung mindestens 95 % der automatisch gesetzten Typen richtig gewesen wären. Ein Beispiel aus der Praxis: Bei etwa 70 % der Dokumente war die Entscheidung sicher genug, davon waren etwa 96 % richtig. Bei allen anderen bleibt der Typ leer.

  • Vorschläge zum Anklicken: Ist der Typ eines Dokuments leer, zeigt das Dokument unter „Dokumenttyp“ bis zu drei gelernte Vorschläge („Gelernt, Vorschlag:“). Grün = das Programm war sicher, violett = nicht sicher genug. Ein Klick trägt den Typ nur ins Feld ein; gespeichert wird erst mit „Speichern“, und erst dann zählt er als bestätigt.
  • Regeln: Ein Typ aus einer Regel gilt nur, wenn das Gelernte denselben Typ als beste Wahl nennt. Ist das Gelernte sicher und anderer Meinung, gewinnt das Gelernte. Widerspricht es, ohne sicher zu sein, bleibt der Typ leer. Ein Typ, den das Gelernte noch gar nicht kennt (weniger als 3 bestätigte Dokumente), wird von den Regeln nicht gesetzt, bis genug bestätigte Dokumente vorliegen.
  • Regeln anwenden (Dokument oder Sammelaktion) füllt leere Typen nach denselben Grundsätzen; vorhandene Typen werden nie überschrieben.

Voraussetzungen und Zustand

Gelernt wird erst ab 30 bestätigten Dokumenten mit mindestens zwei Typen zu je mindestens 3 Dokumenten; vorher bleibt alles wie bisher (Regel-Typen gelten ohne Prüfung). Den Zustand zeigen Einstellungen → Dokumenttyp beim Import und der Regeldialog: wie viele Dokumente gelernt wurden, wie viele davon automatisch gesetzt würden, mit welcher erwarteten Trefferquote, und welche Typen noch zu wenig Beispiele haben. Gibt es keine Schwelle mit mindestens 95 %, setzt das Programm nichts selbst und schlägt nur vor.

Abschalten: Einstellungen → Dokumenttyp beim Import → Haken entfernen. Dann gilt der Typ aus den Regeln wie bis 0.2.39 (ohne Prüfung). Die Einstellung gilt je Rechner.
Grenzen: Die erwartete Trefferquote ist eine Schätzung aus Ihren eigenen Dokumenten; bei wenigen Dokumenten pro Typ schwankt sie. Falsch bestätigte Typen (etwa ein Typ, den Sie beim Speichern aus Versehen stehen ließen) werden mitgelernt – korrigieren Sie sie einfach im Dokument, das Modell passt sich beim nächsten Import an. Gelernt wird aus dem erkannten Text und dem Dateinamen; ein Dokument ohne erkannten Text bekommt keinen gelernten Typ. Der Korrespondent wird nicht gelernt, sondern über Namen erkannt (nächster Abschnitt); Themen werden nur vorgeschlagen.

Korrespondent erkennen – über Namen und Kennzeichen (ab 0.2.43)

Wozu: Eine Messung an einem echten Archiv zeigte, dass Lernen für den Korrespondenten nicht taugt (nur 64 % richtig), der Name aber meist schon im Dateinamen, im Titel oder in den ersten Zeilen steht – „… - DER SPIEGEL.pdf“, „ct.21 Spam.pdf“, „Rechnung, Stefan Haberl“. Seit 0.2.43 sucht das Programm deshalb beim Import nach den Korrespondenten, die Sie schon vergeben haben, und nach deren Kennzeichen.

So wird entschieden

  • Gesucht wird jeder Name als ganzes Wort (bzw. ganze Wortfolge), Groß-/Kleinschreibung, Umlaute und Satzzeichen dazwischen spielen keine Rolle: „DER SPIEGEL“ findet auch „der-spiegel“, „St. Georgen“ auch „St Georgen“; „Welt“ findet nicht „Umwelt“.
  • Drei Stufen: Dateiname oder Titel (am stärksten), Kopf des Dokuments (die ersten 8 Zeilen bzw. 400 Zeichen), irgendwo im Text (zu unsicher – „Welt“, „Zeit“ oder „amazon“ stehen in vielen Artikeln).
  • Eingetragen wird ein Korrespondent nur, wenn genau einer die höchste gefundene Stufe erreicht und diese mindestens „Kopf des Dokuments“ ist. Sonst bleibt das Feld leer und das Dokument zeigt unter „Korrespondent“ Vorschläge zum Anklicken (grün = eindeutig, violett = nicht eindeutig).
  • Kurze Namen (weniger als 3 Buchstaben/Ziffern, z. B. „ct“, „SZ“) zählen nur im Dateinamen oder Titel – im Text wären sie zu oft zufällig („5 ct“).
  • Platzhalter wie „divers“, „Unbekannt“, „Sonstige“ werden nie erkannt oder gesetzt.
  • Eine Regel, die einen Korrespondenten setzt, hat Vorrang (sie ist Ihre ausdrückliche Vorgabe); ebenso der Absender einer importierten E-Mail.
  • Automatisch Eingetragenes ist im Dokument mit „automatisch – bitte prüfen“ markiert, bis Sie das Dokument speichern. Erst dann gilt der Korrespondent als von Ihnen bestätigt.

Selbstkontrolle an Ihren Dokumenten

Das Programm prüft jeden Namen an den Dokumenten, die Sie selbst bearbeitet haben: Wie oft führte ein Treffer in Dateiname/Titel/Kopf zum richtigen Korrespondenten? Ab 3 Treffern mit weniger als 90 % richtig setzt dieser Name nicht mehr selbst, sondern wird nur noch vorgeschlagen. Automatisch eingetragene, noch nicht gespeicherte Korrespondenten zählen dabei nicht – das Programm prüft sich nicht an seinen eigenen Entscheidungen. Messung am echten Archiv (220 Dokumente): 61 richtig, 0 falsch, dazu 17 Dokumente ohne Korrespondent, bei denen er eindeutig zu finden war (Stichproben alle richtig).

Verwalten → Korrespondent-Erkennung …

  • Kennzeichen: weitere Schreibweisen, unter denen ein Korrespondent auftritt, mit Komma getrennt – z. B. bei „ct“: „heise online, c’t“; bei „die Zeit“: „ZEIT ONLINE“; bei einer Firma eine Internetadresse wie „stadtwerke-musterstadt.de“. Höchstens 20 je Korrespondent. Kennzeichen sind auch für Korrespondenten möglich, die noch kein Dokument haben.
  • Nie automatisch: dieser Korrespondent wird nur vorgeschlagen.
  • Prüfung: „x von y richtig“ aus der Selbstkontrolle; rot = wird nur noch vorgeschlagen.
  • Bei vorhandenen Dokumenten nachtragen: „Dokumente ohne Korrespondent prüfen …“ listet alle Dokumente ohne Korrespondent mit eindeutigem Treffer. Häkchen entfernen, was nicht stimmt, dann „Ausgewählte eintragen“. Vorhandene Korrespondenten werden nie überschrieben; alles ist rückgängig machbar.
  • Die Kennzeichen liegen im Archiv (konfig\korrespondenten.json) und reisen mit ihm. Umbenennen oder Zusammenführen unter Verwalten → Tags, Korrespondenten, Typen zieht die Kennzeichen mit (der alte Name wird dabei zum Kennzeichen, damit er weiter erkannt wird); Löschen entfernt sie.
  • Regeln anwenden im Dokument bzw. als Sammelaktion trägt einen eindeutig erkannten Korrespondenten ebenfalls nach (nur bei leerem Feld).
Abschalten: Einstellungen → Korrespondent, Betrag und Fälligkeit beim Import. Die Einstellung gilt je Rechner.

Themen-Vorschläge – gelernt, nie automatisch (ab 0.2.43)

Im Dokument stehen über den Themen-Knöpfen bis zu drei Themen, die vermutlich passen („Passt vermutlich:“). Ein Klick fügt das Thema dem Tag-Feld hinzu; gespeichert wird erst mit „Speichern“. Themen werden nie selbst gesetzt.

  • Gelernt wird wie beim Dokumenttyp aus Ihren Dokumenten, die ein Thema haben und nach dem Import von Ihnen bearbeitet wurden (ein Dokument mit zwei Themen zählt für beide). Voraussetzung: mindestens 20 solche Dokumente und mindestens zwei Themen mit je 3 Dokumenten.
  • Vorgeschlagen wird nur, was nicht schon im Tag-Feld steht; schwache Treffer (Ähnlichkeit unter 0,10 oder unter der Hälfte des besten) entfallen – gemessen waren sie nur zu 15 % richtig.
  • Messung am echten Archiv (206 Dokumente mit Themen): Bei rund 81 % stand mindestens ein richtiges Thema unter den Vorschlägen, der erste Vorschlag stimmte in rund 68 % – gut für Vorschläge, zu unsicher zum selbst Setzen.

RegEx kurz erklärt (ab 0.2.31)

RegEx (Regular Expression, „regulärer Ausdruck“) beschreibt ein Textmuster statt eines festen Wortes. Statt nach „Rechnung Nr. 4711“ zu suchen, beschreibt man „das Wort Rechnung, dann Nr., dann Ziffern“. Das eignet sich für Datumsangaben, Beträge, Nummern, IBAN oder E-Mail-Adressen – überall, wo der Inhalt wechselt, die Form aber gleich bleibt.

RegEx versteht keine Bedeutung, nur Zeichenfolgen. Ein Muster wie \d+ („Ziffern“) trifft jede Zahl, nicht nur Rechnungsnummern. Wählen Sie Muster so genau, dass sie nur das gewünschte treffen, und prüfen Sie sie am Testfeld.

So wendet Babierlos-BL das Muster an

  • Gesucht wird im erkannten Text des Dokuments (und im Dateinamen). Das Muster darf irgendwo im Text vorkommen (kein Anfang/Ende nötig).
  • Groß-/Kleinschreibung ist egal (rechnung trifft auch „RECHNUNG“); der Punkt . trifft auch Zeilenumbrüche.
  • Es gilt die RegEx-Schreibweise von Python (Modul re). Testfeld und Trefferzahl prüfen Muster bis 500 Zeichen und Beispieltexte bis 20 000 Zeichen.

Die wichtigsten Zeichen

ZeichenBedeutungBeispiel
\deine Ziffer (0–9)\d\d trifft „42“
\wBuchstabe, Ziffer oder Unterstrich\w+ trifft ein Wort
\sLeerraum (Leerzeichen, Tab, Zeilenumbruch)Nr\s*\d trifft „Nr 4“ und „Nr4“
.irgendein Zeichena.c trifft „abc“, „a-c“
\.ein echter Punkt (Sonderzeichen mit \ „entschärfen“: \. \( \) \+ \* \? \[ \$)Nr\. trifft „Nr.“
+ein- oder mehrmals das Zeichen davor\d+ trifft „4711“
*null- oder mehrmals\s* trifft auch „kein Leerzeichen“
?null- oder einmal (optional)Nr\.? trifft „Nr“ und „Nr.“
{n} {n,m}genau n bzw. n bis m Mal\d{4} trifft ein Jahr
[abc] [0-9]eines der Zeichen bzw. aus dem Bereich[0O] trifft Null und großes O (OCR-Verwechslung)
( ) (?: )Gruppe (zusammenfassen); (?: ) ohne Merken(?:€|EUR) trifft „€“ oder „EUR“
|oderRechnung|Quittung
\bWortgrenze\bDE\d{2} trifft „DE02“, nicht „ADE02“
^ $Anfang bzw. Ende des gesamten Textesselten nötig

Beispiele (im Regeldialog zum Anklicken)

NameMusterBeispieltextErklärung
Datum\b\d{1,2}\.\d{1,2}\.\d{4}\bRechnung vom 15.10.2026, Lieferung am 3.11.20261–2 Ziffern, Punkt, 1–2 Ziffern, Punkt, 4 Ziffern: 15.10.2026
Betrag in Euro\d{1,3}(?:\.\d{3})*,\d{2}\s*(?:€|EUR)Gesamtbetrag 1.234,56 €Tausenderpunkte, Komma, zwei Cent-Stellen, dann € oder EUR
RechnungsnummerRechnungs?\s*-?\s*(?:Nr\.?|nummer)\s*:?\s*\d+Rechnungsnummer: 4711„Rechnung Nr.“, „Rechnungs-Nr“ oder „Rechnungsnummer“, dann Ziffern
KundennummerKunden-?(?:Nr\.?|nummer)\s*:?\s*\d+Kunden-Nr.: 123456„Kundennummer“ oder „Kunden-Nr.“, dann Ziffern
IBAN (Deutschland)\bDE\d{2}(?:\s?\d{4}){4}\s?\d{2}\bIBAN: DE02 1203 0000 0000 2020 51DE, 2 Prüfziffern, dann Vierergruppen (Leerzeichen erlaubt)
E-Mail-Adresse[\w.+-]+@[\w-]+(?:\.[\w-]+)+Kontakt: service@stadtwerke-musterstadt.deName, @, Domain mit Punkt

Häufige Stolperstellen

  • Sonderzeichen ohne \: Ein Punkt, eine Klammer oder ein Plus hat im Muster eine Sonderbedeutung. „Nr.“ als Muster trifft auch „Nra“; gemeint ist Nr\..
  • Klammer vergessen: Jede ( braucht eine ), jede [ eine ]. Das Testfeld meldet es sofort mit der Stelle.
  • Zu allgemein: \d+ oder .* treffen fast jedes Dokument. „Auf mein Archiv anwenden“ zeigt es: trifft die Regel auf fast alle Dokumente zu, ist das Muster zu weit.
  • Leerraum im erkannten Text: Die Texterkennung setzt Leerzeichen und Umbrüche nicht immer wie im Original. Statt eines festen Leerzeichens besser \s* verwenden.
  • Verwechslungen der Texterkennung (0/O, 1/l/I, 5/S): bei Nummern mit Buchstaben eine Zeichenklasse nehmen, z. B. [0O].
  • Zeitüberschreitung: Verschachtelte Wiederholungen wie (a+)+ können extrem lange dauern. Das Programm beendet den Test nach wenigen Sekunden (in einem eigenen Hilfsprozess, der hart abgebrochen wird); bitte das Muster vereinfachen.

Themen – feste, erweiterbare Tags (ab 0.2.17)

Wozu Tags? Tags fassen mehrere Dokumente zusammen und finden, was die Volltextsuche nicht findet (z. B. „Heizung“ an einer Handwerkerrechnung, in der das Wort nicht steht). Einmalige Beschreibungen („Microsoft Tastatur + Maus“) gehören in den Titel, Datum, Absender und Art stehen schon in Datum, Korrespondent und Dokumenttyp. Ein Tag an nur einem Dokument hilft beim Filtern nicht.

Themen sind eine feste Liste solcher Tags (z. B. Rente, Steuer, Haus & Grundstück). Sie liegt im Archiv (konfig\themen.json) und gilt damit auf jedem Rechner.

  • Im Dokument (Anordnung neu in 0.2.20): Die Themen stehen als Chips in voller Breite unter Dokumenttyp und Tags – ohne Bildlauf, höchstens zwei Zeilen, die meistgenutzten zuerst (Klick übernimmt das Thema). Passt mehr hinein, erscheint links unter „Dokumenttyp“ die Schaltfläche „Alle Themen (n)“; sie zeigt alle, „Weniger anzeigen“ kürzt wieder auf zwei Zeilen. Die Wahl wird je Rechner gespeichert, die Zeilenzahl passt sich der Breite des Angaben-Bereichs an. Beim Tippen im Tag-Feld erscheinen nur die passenden Themen (höchstens 8). Daneben steht „Vorschläge aus dem Text“. (In 0.2.19 waren die Themen eingeklappt und scrollten in einem Kasten – das entfällt.) Ein Tag, der kein Thema ist, wird angezeigt („Kein Thema: …“) – mit „als Thema aufnehmen“ wird die Liste erweitert. Lange Einträge werden markiert („sieht nach Beschreibung aus“); über 40 Zeichen werden sie nicht gespeichert (bis 0.2.16 wurden sie stillschweigend gekürzt).
  • Vorschläge aus dem Text: zuerst passende Themen und schon verwendete Tags; neue Wörter erst nach „mehr …“.
  • Verwalten → Reiter „Themen“: Thema hinzufügen, umbenennen (gilt für alle Dokumente), aus der Liste nehmen (die Tags an den Dokumenten bleiben). Im Reiter „Tags“ kennzeichnet ★ die Themen; „★ als Thema“ nimmt einen Tag auf; der Filter „nur an 1 Dokument“ mit „Alle sichtbaren auswählen“ hilft beim Aufräumen.
  • Auf Themen umstellen … (Reiter „Themen“): liest eine Zuordnungsdatei (CSV, z. B. aus Excel; Trennzeichen Semikolon): je Zeile Thema;alter Tag, alter Tag, …. Angaben in Klammern („(7)“), die Kopfzeile und die Zeile „(entfällt)“ werden übergangen. Die Vorschau zeigt vorher, wie viele Tags es danach gibt, welche Dokumente geändert werden und welche Tags entfallen; wahlweise bleiben Tags ohne Thema erhalten. „Umstellen“ ändert alle Dokumente (auch im Papierkorb) und die Regeln und speichert die Themenliste – Rückgängig stellt alles wieder her.

Tags, Korrespondenten und Typen verwalten (ab 0.2.16)

Menü Verwalten → Tags, Korrespondenten, Typen verwalten … oder der Stift ✎ neben der jeweiligen Überschrift in der Seitenleiste. Drei Reiter zeigen alle Einträge mit Anzahl der Dokumente (und wie viele davon im Papierkorb liegen); oben lässt sich die Liste filtern.

  • Umbenennen …: neuer Name für alle Dokumente. Gibt es den Namen schon, werden beide zusammengeführt (Rückfrage).
  • Zusammenführen … (mindestens zwei ankreuzen): z. B. „Telekom“, „telekom“ und „Deutsche Telekom“ zu einem Namen; vorgeschlagen wird der meistverwendete.
  • Löschen …: entfernt den Eintrag aus allen Dokumenten; die Dokumente selbst bleiben.

Es gilt für alle Dokumente einschließlich Papierkorb; Groß-/Kleinschreibung spielt beim Erkennen keine Rolle. Änderungen an Korrespondent und Typ benennen die Dateien im Archiv um. Regeln, die den alten Namen setzen, werden mit angepasst; eine Regel, die danach nichts mehr setzt (z. B. nur einen gelöschten Tag), wird entfernt – die Meldung nennt sie. Alles zusammen lässt sich mit Rückgängig zurücknehmen. Hinweis: Standard-Dokumenttypen (Rechnung, Vertrag …) bleiben als Vorschlag in der Auswahlliste, auch wenn kein Dokument sie mehr trägt.

Eigene Felder – Betrag, Fälligkeit & mehr (ab 0.2.18)

Zusätzlich zu Titel, Datum, Korrespondent, Typ und Tags kann jedes Dokument eigene Felder tragen. Beim ersten Start sind Betrag und Fälligkeit vorhanden. Weitere Felder legen Sie über Verwalten → Eigene Felder verwalten (Betrag, Fälligkeit …) … an (auch über die Schaltfläche „Felder“ über der Dokumentliste oder „Eigene Felder verwalten …“ im Dokument).

ArtEingabe
BetragZahl mit Cent, z. B. 1.234,56 oder 1234.56; gespeichert auf Cent gerundet
Zahlganze oder Dezimalzahl
DatumTT.MM.JJJJ oder JJJJ-MM-TT
Ja/Neinz. B. „Bezahlt“ (kein Standardfeld – bei Bedarf anlegen)
Textbis 200 Zeichen

Zahlenschreibweise: „1,5“ gilt als 1,5; ein Punkt allein vor genau drei Ziffern gilt als Tausendertrenner („1.234“ = 1234). Bei Unsicherheit bitte Komma als Dezimaltrenner verwenden.

  • Verwalten: anlegen, umbenennen, Reihenfolge ändern, löschen (bis zu 20 Felder, Namen bis 30 Zeichen). Beim Löschen werden die Werte aus allen Dokumenten entfernt; die Meldung nennt die Anzahl.
  • Anzeigen: Werte erscheinen als Chips in der Liste und als Eingabefelder im Dokument.
  • Filtern: über der Liste „Felder“ → Bedingung je Feld: gesetzt, leer, Bereich von … bis … (Betrag, Zahl, Datum), ja/nein, enthält (Text). Datumsbereiche kennen Voreinstellungen mit heute, heute±N (Tage), monatsanfang, monatsende; sie werden bei jeder Anwendung neu berechnet, auch in gespeicherten Ansichten (z. B. „Fällig in den nächsten 14 Tagen“).
  • Sortieren: nach jedem eigenen Feld; Dokumente ohne Wert stehen am Ende.
  • Summen: für Betrags- und Zahlenfelder zeigt die Liste die Summe über alle Treffer des aktuellen Filters (nicht nur die angezeigte Seite); Dokumente im Papierkorb zählen nicht.
  • Sammelaktion „Feld setzen“: setzt (oder leert) ein Feld bei allen ausgewählten Dokumenten. Der Wert wird vorher geprüft, bei einem Fehler wird nichts geändert.
  • Zusammenfügen: je Feld gilt der erste vorhandene Wert der Ursprungsdokumente. Teilen: der erste Teil behält die Werte, weitere Teile erhalten keine (so werden Summen nicht doppelt gezählt).
  • Rückgängig: Werte ändern, Sammelaktion „Feld setzen“ und Änderungen an der Felddefinition lassen sich zurücknehmen.

Felder sind in der JSON-Datei des Dokuments unter felder gespeichert, die Definitionen in konfig/felder.json. Der Suchindex erhält dafür Schema 2 und wird beim ersten Start mit 0.2.18 automatisch neu aufgebaut (kann bei großen Archiven etwas dauern).

Fälligkeit, Erinnerungen und Vorschläge aus dem Text (ab 0.2.30)

Das Programm weist auf Dokumente hin, deren Fälligkeit erreicht oder überschritten ist. Grundlage ist das Datumsfeld Fälligkeit (Standardfeld, siehe „Eigene Felder“) – oder, falls Sie es gelöscht haben, ein anderes Datumsfeld, dessen Name „fällig“ enthält. Gibt es kein solches Feld, entfallen die Erinnerungen.

MarkierungBedeutung
rot „überfällig seit n Tagen“Fälligkeit liegt vor heute
orange „heute fällig“ / „morgen fällig“ / „fällig in n Tagen“Fälligkeit heute bis heute + n Tage (Standard n = 7)
gelber Chip mit DatumFälligkeit liegt weiter in der Zukunft (keine Hinweise); ohne eingetragene Fälligkeit erscheint nichts
„erledigt“ (grauer Chip in der Liste, grün im Dokument)Sie haben Fälligkeit erledigt gesetzt (z. B. nach der Überweisung)
  • Seitenleiste „Fällig“: zeigt die Zahl der überfälligen und bald fälligen Dokumente (rot, sobald etwas überfällig ist). Ein Klick listet sie, nach Fälligkeit aufsteigend sortiert (das Älteste zuerst); ein zweiter Klick beendet den Filter und stellt die vorherige Sortierung wieder her.
  • Hinweisleiste oben in der Liste („Fälligkeiten: 2 Dokumente überfällig, 1 fällig in den nächsten 7 Tagen“) mit Anzeigen und Ausblenden (bis zum nächsten Programmstart); sie erscheint nicht, solange die Ansicht „Fällig“ offen ist. Ganz abschaltbar unter Einstellungen → Fälligkeit & Erinnerung. Es gibt keine Meldung außerhalb des Programmfensters.
  • Erledigt markieren: im Dokument das Kontrollkästchen Fälligkeit erledigt (oder der Knopf in der Aktionsleiste) – bei mehreren markierten Dokumenten die Sammelaktion Fälligkeit erledigt. Zurücknehmen: Kontrollkästchen im Dokument wieder abwählen oder Rückgängig. Das Datum bleibt erhalten, das Dokument zählt nur nicht mehr. Alles ist über Rückgängig zurücknehmbar.
  • Dokumente im Papierkorb zählen nicht. Ändern Sie die Fälligkeit, bleibt „erledigt“ gesetzt, bis Sie es zurücknehmen (bei wiederkehrenden Rechnungen das jeweils neue Dokument verwenden).
  • Gespeicherte Ansichten können den Filter „Fällig“ enthalten. Er wird bei jedem Anwenden neu ausgewertet (relativ zum heutigen Tag).
  • Einstellungen (je Rechner): „Bald fällig“ ab … Tage vor dem Termin (0–365, Standard 7) und „Beim Start … hinweisen“.

Vorschläge für Betrag und Fälligkeit

Öffnen Sie ein Dokument mit erkanntem Text, schlägt das Programm unter den Feldern Betrag und Fälligkeit bis zu drei Werte als anklickbare Chips vor – mit dem Grund („Gesamtbetrag“, „zahlbar bis“, „14 Tage nach Dokumentdatum“ …). Ein Klick trägt den Wert in das Feld ein; gespeichert wird erst mit „Speichern“. Ab 0.2.43 werden eindeutige Werte bei Rechnungen und Mahnungen schon beim Import eingetragen (siehe unten); in allen anderen Fällen bleibt es beim Vorschlag. Eine Sammelaktion dafür gibt es nicht.

  • Betrag: erkannt werden deutsche Beträge mit Cent („1.234,56 €“, „EUR 23,80“) sowie „1234.56 EUR“. Ab 0.2.37 zusätzlich: Tabellen mit getrennten Spalten (Bezeichnungen „Netto, MwSt, Gesamtbetrag“ als Block, die Beträge darunter – der k-te Betrag gehört zur k-ten Bezeichnung), Tausenderleerzeichen („1 234,56“ = 1.234,56; nur bei eindeutigem Schlüsselwort, sonst könnte „2 100,00“ auch „Menge 2, Preis 100,00“ sein), den Betrag in der Zeile unter der Bezeichnung (auch nach Leerzeilen), Punktformat ohne € („Gesamtbetrag 119.00“), OCR-Leerzeichen („119, 00“) und ganze Euro-Beträge („119 €“, „119,-“); diese schwächeren Schreibweisen zählen nur bei eindeutigem Schlüsselwort und nie vor Einheiten („3.50 Stk“). Stehen mehrere Beträge in einer Zeile, zählt die Bezeichnung direkt vor dem Betrag. Brutto/Netto: „incl./inkl. MwSt“ kennzeichnet den Bruttobetrag (Zahlbetrag), „zzgl. MwSt“ den Nettobetrag; ist ein Betrag gleich einem anderen plus 19 % bzw. 7 % Mehrwertsteuer, schlägt das Programm ihn vor dem Nettobetrag vor und vermerkt „netto + MwSt“ im Chip. Das gilt auch, wenn beide Zeilen „Gesamtbetrag“ heißen. Stichwörter wie Gesamtbetrag, Endbetrag, zu zahlender Betrag, Rechnungsbetrag, zahlbar zählen am stärksten; Einzelposten, Zwischensummen und Mehrwertsteuer werden niedriger bewertet, Prozentwerte, Telefon- und IBAN-Zahlen nicht vorgeschlagen.
  • Fälligkeit: „zahlbar bis 15.10.2026“, „fällig am …“, „Zahlungsziel …“, „spätestens …“; „zahlbar innerhalb von 14 Tagen“ bzw. „14 Tage netto“ wird ab dem Dokumentdatum gerechnet (Kennzeichnung „hergeleitet“ im Chip-Hinweis). Nicht vorgeschlagen werden Rechnungs-, Liefer- und Leistungsdaten, Zeiträume, Geburts-/Vertragsdaten und „war fällig am …“. Skonto-Fristen („bei Zahlung bis … 2 % Skonto“) erscheinen nur nachrangig als „Skontofrist“.
  • Grenzen: Es ist eine Heuristik auf dem erkannten Text. Bei schlechter Texterkennung, ungewöhnlichen Layouts oder mehreren Beträgen kann der beste Vorschlag falsch sein – bitte immer mit dem Dokument vergleichen. Werktage, Feiertage und fremde Zahlenformate (z. B. „1,234.56“) werden nicht ausgewertet; verwechselte Ziffern der Texterkennung (z. B. „O“ statt „0“ im Betrag) werden nicht korrigiert. Die Vorschläge erscheinen auch bei bereits eingelesenen Rechnungen (sie werden beim Öffnen aus dem gespeicherten Text berechnet). Ohne erkannten Text (zu kurz, kein OCR) gibt es keine Vorschläge.

Betrag und Fälligkeit beim Import vorbelegen (ab 0.2.43)

Beim Import trägt das Programm Betrag und Fälligkeit nur ein, wenn alles Folgende zutrifft – sonst bleibt es bei den Vorschlägen zum Anklicken:

  • Der Dokumenttyp (aus Regel oder Gelerntem) ist eine Rechnung oder Mahnung (der Typname enthält eines dieser Wörter).
  • Betrag: Der beste Vorschlag ist eindeutig – mindestens 100 Punkte und mindestens 25 Punkte vor dem zweitbesten (z. B. „Gesamtbetrag inkl. MwSt“, „zu zahlender Betrag“, „Rechnungsbetrag“). Gutschriften (negativ) werden nicht eingetragen.
  • Fälligkeit: nur zusammen mit einem eindeutigen Betrag, nur wenn sie ausdrücklich im Text steht („zahlbar bis …“, „fällig am …“ – nicht „14 Tage nach Rechnungsdatum“) und nur, wenn sie noch nicht vorbei ist. Sonst würde jede alte Rechnung, die Sie nachträglich einlesen, als „überfällig“ gemeldet.

Eingetragene Werte sind im Dokument mit „automatisch – bitte prüfen“ markiert. Mit „Speichern“ gelten sie als von Ihnen bestätigt; ein falscher Wert lässt sich einfach überschreiben oder löschen. Bereits vorhandene Dokumente werden nicht verändert. Messung am echten Archiv (26 Rechnungen): Die Regel griff bei 14; bei allen 7 davon, für die Sie selbst einen Betrag eingetragen hatten, stimmte er überein. Bei der einzigen Rechnung, deren bester Vorschlag falsch war, greift sie nicht.

Abschalten: Einstellungen → Korrespondent, Betrag und Fälligkeit beim Import → „Betrag und Fälligkeit … eintragen“.

Gespeichert wird im JSON des Dokuments das Feld faellig_erledigt (true/false; fehlt es, gilt „offen“). Der Suchindex erhält dafür Schema 4 und wird beim ersten Start mit 0.2.30 automatisch neu aufgebaut.

Gespeicherte Ansichten (ab 0.2.18)

Eine Ansicht merkt sich Suchtext, Filter (Korrespondent, Typ, Tag, Jahr, Texterkennung, Posteingang, Fällig, Neu importiert), Feldfilter und Sortierung unter einem Namen – z. B. „Offene Rechnungen“ oder „Fällig in 14 Tagen“. Sie stehen in der Seitenleiste unter Ansichten.

  • Speichern: + neben „Ansichten“ speichert den aktuellen Zustand (Name bis 40 Zeichen, eindeutig; höchstens 50 Ansichten).
  • Anwenden: Klick auf den Namen; die aktive Ansicht ist hervorgehoben, solange nichts daran geändert wurde.
  • Verwalten: ✎ neben „Ansichten“ (oder Verwalten → Gespeicherte Ansichten verwalten …): umbenennen, löschen, Reihenfolge.
  • Relative Datumsangaben (heute …) werden beim Anwenden neu ausgewertet. Verweist eine Ansicht auf ein inzwischen gelöschtes Feld, wird dieser Teil übergangen.
  • Gespeichert in konfig/ansichten.json im Archiv; Änderungen sind rückgängig machbar.

Rückgängig (ab 0.2.15)

Die Schaltfläche Rückgängig in der Kopfleiste (oder Strg+Z, wenn kein Eingabefeld aktiv ist) nimmt den letzten Schritt zurück; erneutes Drücken geht weiter zurück. Der Mauszeiger über der Schaltfläche zeigt, was zurückgenommen wird. Nach vielen Aktionen erscheint außerdem eine Meldung mit „Rückgängig“.

Lässt sich rückgängig machenNicht rückgängig
Angaben speichern (Titel, Datum, Korrespondent, Typ, Tags, Notiz – samt Dateinamen im Archiv) · In den Papierkorb / Wiederherstellen (einzeln, Sammelaktion, aus „Quelle abgleichen“ und „Archiv aufräumen“) · Zusammenfügen (die Ursprungsdokumente kommen zurück, das zusammengefügte Dokument wird entfernt) · Seiten bearbeiten (ordnen, drehen, entfernen, teilen) · Umbenennen, Zusammenführen, Löschen von Tags, Korrespondenten, Typen (samt Regeln) · Themenliste ändern · Eigene Felder (Werte, Sammelaktion, Definitionen) · Fälligkeit erledigt (einzeln und Sammelaktion) · Gespeicherte Ansichten · Auf Themen umstellen · Sammelaktionen Tags, Korrespondent, Typ, Regeln anwenden, Tags aus Datei Import · Texterkennung nachholen · Endgültig löschen · Änderungen an Einstellungen und Regeln
  • Der Verlauf gilt bis zum Beenden des Programms und umfasst die letzten 30 Schritte.
  • Wurde ein betroffenes Dokument nach dem Schritt anderweitig verändert (z. B. Texterkennung nachgeholt oder endgültig gelöscht), wird der Schritt nicht zurückgenommen – es erscheint eine Meldung, und nichts wird verändert.
  • Ungespeicherte Eingaben im geöffneten Dokument: Rückgängig fragt vorher nach, ob sie verworfen werden sollen.

Papierkorb

Dokumente im Papierkorb lassen sich über den Haken „Papierkorb mitsuchen“ in der Suche finden (ab 0.2.39, siehe „Suchen & Ordnen“); die Suche verändert nichts.

„In den Papierkorb“ blendet ein Dokument nur aus (die Dateien bleiben; jederzeit Wiederherstellen). Endgültig löschen (nur im Papierkorb, mit Rückfrage) entfernt nur aus dem Archiv dieses Programms die PDF und die beim Import dort abgelegte Kopie der Originaldatei unwiderruflich. Ihre ursprüngliche Datei (im Quellordner, im Scanner-Eingangsordner, im Unterordner _verarbeitet, als Download oder E-Mail-Anhang) und bereits angelegte Sicherungen werden nie gelöscht oder verändert – wer ein Dokument komplett vom PC entfernen will, löscht diese Dateien selbst. Die Rückfrage nennt beides ausdrücklich („Wird gelöscht“ / „Bleibt unberührt“) – im Dokument oder, ab 0.2.23, für alle angehakten Dokumente über die Aktionsleiste (dort neben „Wiederherstellen“). Eine winzige Löschmarke <ID>.geloescht.json ohne Inhalt bleibt zurück, damit die spätere Synchronisierung zwischen Rechnern weiß, dass das Dokument gelöscht wurde.

Einstellungen

Ab 0.5.3 ist das Einstellungsfenster in fünf Reiter gegliedert. „Speichern“ übernimmt die Änderungen aller Reiter auf einmal. Ausnahmen: „Mit Windows starten“ wirkt sofort, und die Sicherung hat ihr eigenes Fenster.

ReiterInhalt
AllgemeinArchivordner, Programmstart (Mit Windows starten), Updates, Einstellungen übertragen
ImportEingangsordner (Scanner), Quellordner, Posteingang, Bilder, Tags, Texterkennung (Tesseract), Office-Dateien (LibreOffice)
ErkennungDokumenttyp lernen, Korrespondent/Betrag/Fälligkeit beim Import, Fälligkeit & Erinnerung
SicherungStand der Sicherung (Ziel, Zeitpunkte, letzte Sicherung) und das Sicherungsfenster (einrichten, jetzt sichern, prüfen, wiederherstellen). Die Sicherung gibt es nur hier; der Eintrag unter „Verwalten“ entfiel mit 0.5.3.
DarstellungErscheinungsbild, Browser, Fenster, Kopfleiste

Die einzelnen Einstellungen:

EinstellungBedeutung
ArchivordnerOrt des Archivs. Eine Änderung öffnet ein anderes/neues Archiv; vorhandene Dokumente werden nicht verschoben.
EingangsordnerScanner-Ordner, siehe „Importieren“. Darf nicht innerhalb des Archivs liegen.
Office-Dateien (LibreOffice-Pfad)Standard: LibreOffice automatisch suchen. Nur bei portabler oder ungewöhnlicher Installation den Pfad zur soffice.exe eintragen. Der Abschnitt zeigt, ob LibreOffice gefunden wurde, und den Download-Link.
Tesseract-Pfad, Sprachen, AuflösungStandard: automatisch suchen, deu+eng, 300 dpi (gilt für das Rendern gescannter PDFs; 150–600).
Dokumenttyp beim Import (ab 0.2.40)„Aus meinen bestätigten Dokumenten lernen und bei ausreichender Sicherheit automatisch setzen“ (Standard: an). Darunter steht der Zustand: gelernte Dokumente, Anteil sicher gesetzter Typen, erwartete Trefferquote. Aus: Der Typ kommt nur aus den Regeln wie bisher. Siehe „Dokumenttyp lernen“. Gilt je Rechner.
Korrespondent, Betrag und Fälligkeit beim Import (ab 0.2.43)„Korrespondent über Namen und Kennzeichen erkennen“ und „Betrag und Fälligkeit bei Rechnungen und Mahnungen eintragen, wenn das Ergebnis eindeutig ist“ (beide Standard: an). Siehe Korrespondent erkennen und Betrag/Fälligkeit vorbelegen. Gilt je Rechner.
Tags beim Import„Aus der Datei übernehmen“ (Standard: an) und „Unterordnernamen als Tags“ (Standard: aus), siehe „Tags aus Dateien übernehmen“.
PosteingangHerkünfte, deren neue Importe „zu prüfen“ sind: Scanner, Foto, Datei, E-Mail (Standard: an) und Ordnerimport (Standard: aus). Wirkt nur auf künftige Importe, nicht rückwirkend. Siehe „Posteingang“.
Bilder beim ImportWebseiten-Ordner überspringen (an), Größenvarianten zusammenfassen (an), Mindestgröße der langen Seite (400 Pixel, 0 = aus) – siehe „Bilder beim Import aussortieren“. Dazu die Schaltfläche „Vorhandenes Archiv aufräumen“.
ErscheinungsbildWie Windows / Hell / Dunkel (auch über die Schaltfläche „Design“ in der Kopfleiste).
Kopfleiste immer zweizeilig (ab 0.2.33)Suchfeld mit Programmname oben, Knöpfe mit Beschriftung darunter – unabhängig von der Fensterbreite. Aus (Standard): eine Zeile, bei schmalen Fenstern nur Symbole.
Knopf „Design“ in der Kopfleiste (ab 0.2.33)Ausblendbar, um Platz zu sparen; das Erscheinungsbild bleibt in den Einstellungen wählbar.
Browser, Pfad zum Browsersiehe „Start & Fenster“ (Chromium, Chrome, Edge, Firefox oder Standardbrowser; optional eigene Programmdatei).
QuellordnerListe der Ordner, aus denen Sie importieren (ein Ordner je Zeile) – Grundlage für „Quelle abgleichen“. Ordnerimport und Eingangsordner ergänzen sie automatisch; doppelte und in einem anderen enthaltene Ordner entfallen.
SicherungZielordner, Zeitpunkte und Aufbewahrung der Archiv-Sicherung – eingestellt unter Einstellungen → Reiter Sicherung (siehe „Sicherung“). Gilt je Rechner.
Fälligkeit & Erinnerung (ab 0.2.30)„Bald fällig“ = heute bis in n Tagen (0–365, Standard 7) und ob beim Start auf überfällige und bald fällige Dokumente hingewiesen wird. Gilt je Rechner, siehe „Fälligkeit & Erinnerungen“.
Programmstart (ab 0.4.0)„Mit Windows starten“ – Babierlos-BL läuft dann im Infobereich; wirkt sofort, gilt je Windows-Benutzer und Rechner (wird nicht übertragen). Siehe Mit Windows starten.
Beenden beim SchließenProgramm beendet sich, wenn das Fenster zu ist. Bei „Mit Windows starten“ ausgeschaltet lassen.
Einstellungen übertragen (ab 0.2.41)Exportieren in eine Datei / Importieren mit Vorschau – siehe unten.

Einstellungen übertragen auf einen anderen PC (ab 0.2.41)

Einstellungen → Einstellungen übertragen (anderer PC):

  • Exportieren … speichert die (gespeicherten) Einstellungen in eine Datei Ihrer Wahl, z. B. in einem Cloud-Ordner: Babierlos-BL_Einstellungen_v<Version>_<Rechner>_<Datum>.json (ab 0.4.0 mit Programmversion, z. B. Babierlos-BL_Einstellungen_v0.4.0_BUERO-PC_2026-10-08.json; ältere Dateien ohne Version lassen sich weiter importieren). In Chromium/Chrome/Edge erscheint ein „Speichern unter“-Fenster; in anderen Browsern landet die Datei im Ordner „Downloads“.
  • Importieren … auf dem anderen PC: Datei wählen, dann zeigt eine Vorschau, was sich ändert (bisher → neu), was gleich ist, was nicht übernommen wird und welche Ordner es auf diesem Rechner nicht gibt. Erst „Übernehmen“ ändert etwas.
  • Übernommen werden die inhaltlichen Einstellungen: Eingangsordner (samt Überwachung/Verschieben), Quellordner, Texterkennungs-Sprachen und -Auflösung, Tags und Bilder beim Import, Posteingang, Dokumenttyp lernen, Papierkorb mitsuchen, Fälligkeit & Erinnerung, Sicherungsziel und -zeitpunkte, Beenden beim Schließen.
  • Nie übernommen werden der Archivordner und die Programmpfade (Tesseract, LibreOffice, Browser) – sie gehören zum jeweiligen Rechner; fehlende Programme sucht Babierlos-BL selbst (Stand: Systemprüfung).
  • Ansicht und Fenster (Design, Spalten, Breiten, Zoom, Kopfleiste, Browserwahl) nur mit dem Haken „Auch Ansicht und Fenster übernehmen“ – ein Laptop-Bildschirm braucht oft andere Größen.
  • Ungültige Werte und Einstellungen aus einer anderen Programmversion werden übersprungen und genannt; ein Eingangs- oder Sicherungsordner im Archivordner wird abgelehnt, der Rest trotzdem übernommen.
  • Nicht Teil der Einstellungen: Regeln, Themen, eigene Felder und gespeicherte Ansichten liegen im Archiv (konfig\) und reisen mit dem Archiv bzw. der Sicherung. Der Abgleich der Dokumente zwischen zwei PCs ist für 0.3 geplant.

Einstellungen liegen je Rechner in %LOCALAPPDATA%\Babierlos-BL\ (zusammen mit Suchindex und Protokolldatei babierlos.log), damit auf zwei PCs jeweils passende Pfade gelten können. Die Regeln liegen dagegen im Archiv (konfig\regeln.json) und gelten damit für alle Rechner, die dasselbe Archiv nutzen.

Suchindex – Fortschritt, Sperre, Neuanlage (ab 0.2.19)

Der Suchindex ist eine SQLite-Datei unter %LOCALAPPDATA%\Babierlos-BL\index\. Er wird aus den JSON-Dateien des Archivs aufgebaut und kann jederzeit gefahrlos gelöscht werden; die Dokumente selbst werden dabei nie verändert. Ein neues Programmschema (z. B. nach einem Update) löst automatisch einen Neuaufbau aus – so auch beim ersten Start von 0.2.20 (Index-Schema 3 wegen des Posteingangs); er dauert bei einigen hundert Dokumenten wenige Sekunden.

  • Fortschritt: Während des Aufbaus steht in der Statusleiste „Index: 120 von 566“ (ab 5 s mit Dauer) und über der Dokumentliste ein Hinweisstreifen mit Balken. Die Liste ist währenddessen eventuell unvollständig und füllt sich nach dem Ende von selbst.
  • Zeitmessung: babierlos.log (im selben Ordner wie die Einstellungen) enthält je Lauf Beginn, alle 100 Dokumente einen Zwischenstand und am Ende die Dauer getrennt nach Einlesen, Schreiben und Speichern, z. B. „Index: Neuaufbau fertig – 566 Dateien, 566 geändert, 12.3 s (Einlesen 3.1 s, Schreiben 8.9 s, Speichern 0.3 s)“.
  • Ungewöhnlich lange: Dauert ein Neuaufbau länger als 60 Sekunden oder gibt es 20 Sekunden lang keinen Fortschritt, erscheint ein gelber Hinweis mit der Schaltfläche „Index neu anlegen“. Sie bricht den laufenden Aufbau ab, löscht die Index-Datei und baut sie von vorn auf. Dasselbe gibt es jederzeit unter Verwalten → Index neu anlegen ….
  • Index-Datei gesperrt: Hält ein anderer Prozess die Datei fest (meist eine noch laufende ältere Babierlos-BL-Instanz), wartet das Programm höchstens 15 Sekunden und meldet dann „Index-Datei gesperrt, bitte andere Instanz beenden.“ – im Fenster (beim Start im Dialog „Archiv konnte nicht geöffnet werden“, dort „Erneut versuchen“) und im Protokoll. Lösung: Task-Manager öffnen, Python-/babierlos_bl-Prozesse beenden, Programm neu starten.

Archiv prüfen und reparieren – fehlende Metadaten-Datei (ab 0.2.42)

Zu jedem Dokument gehören im Archiv eine PDF und eine Metadaten-Datei (…json mit Titel, Datum, Korrespondent, Typ, Tags, Notiz, eigenen Feldern und erkanntem Text). Fehlt die Metadaten-Datei, meldet das Programm beim Öffnen des Dokuments „Metadaten-Datei des Dokuments fehlt im Archiv“ – mit dem Knopf „Prüfen und reparieren …“.

Ursache bis Version 0.2.41 (Fehler im Programm): Wurde ein Korrespondent oder Typ nur in der Groß-/Kleinschreibung geändert (z. B. „Amazon“ → „AMAZON“, im Dokument, per Sammelaktion oder unter Verwalten → Korrespondenten), schrieb das Programm die neue Metadaten-Datei und löschte danach die „alte“ – unter Windows ist das aber dieselbe Datei. Die PDF blieb erhalten. Ab 0.2.42 behoben: Umbenennen ist jetzt in jeder Form sicher, auch nur in der Schreibweise; Dateien werden nur noch gelöscht, wenn sie nachweislich eine andere Datei sind. Dasselbe gilt für „Rückgängig“ und die Sicherung.

Was das Programm tut

  • Beim Programmstart (und vor „Index neu anlegen“) wird automatisch geprüft. Fehlende Metadaten-Dateien werden aus dem Suchindex wiederhergestellt – vollständig bis auf wenige Angaben, die nur in der Datei standen (Herkunft des Datums, E-Mail-Absender/-Betreff, eigene Seitenreihenfolge, ursprüngliche Dateinamen der Originale). Danach erscheint ein Hinweis „… automatisch wiederhergestellt“.
  • Steht das Dokument nicht mehr im Suchindex, wird es aus PDF und Dateiname wiederhergestellt (Datum, Korrespondent, Typ, Text, Originaldatei) und kommt in den Posteingang; Tags, Notiz und Felder bitte neu eintragen oder aus einer Sicherung (Ordner _alt) nachsehen.
  • Von Hand: Verwalten → „Archiv prüfen und reparieren …“ zeigt, welche Dokumente betroffen sind und woraus sie wiederhergestellt würden; „Wiederherstellen“ schreibt die Dateien. PDF und Originale werden dabei nicht verändert.
  • Endgültig gelöschte Dokumente und Dokumente, deren PDF ebenfalls fehlt, werden nicht wiederhergestellt.

Dateinamen an die Schreibweise angleichen (ab 0.2.43)

Bis 0.2.41 blieb bei einer Änderung nur der Groß-/Kleinschreibung der alte Dateiname stehen (z. B. …_AMAZON_Rechnung_…pdf, obwohl der Korrespondent „amazon“ heißt). Unter Windows schadet das nicht, ist aber verwirrend. Ab 0.2.43 werden solche Namen beim Programmstart automatisch angeglichen; „Archiv prüfen und reparieren …“ zeigt sie ebenfalls („Dateiname passt nicht zur Schreibweise“) und gleicht sie auf Knopfdruck an. Nur der Name ändert sich, nie der Inhalt. Andere Abweichungen (z. B. gekürzte Namen bei einem sehr langen Archivpfad) bleiben unberührt.

Ändern Sie Korrespondenten und Typen ruhig nachträglich – auch nur die Schreibweise. Das ist vorgesehen; die Dateien im Archiv werden passend umbenannt.

Archivformat (Format-Version 1, Index-Schema 4)

Archiv\
  LIES_MICH.txt
  konfig\einstellungen.json   regeln.json   themen.json   felder.json   ansichten.json   korrespondenten.json (ab 0.2.43)
  dokumente\2026\2026-03-12_Stadtwerke-Musterstadt_Rechnung_k3x9qa.pdf
  dokumente\2026\2026-03-12_Stadtwerke-Musterstadt_Rechnung_k3x9qa.json   (Metadaten inkl. eigener Felder + erkannter Text)
  originale\2026\k3x9qa.original.jpg

Je Original steht in der JSON-Datei u. a. name, sha256, groesse und – wenn beim Import bekannt – quell_pfad (ab 0.2.12; ein zusätzliches Feld, die Format-Version bleibt 1; ältere Programme ignorieren es). Ebenso kennzeichnet "faellig_erledigt": true (ab 0.2.30) eine als erledigt markierte Fälligkeit (fehlt das Feld oder hat es einen anderen Wert, gilt „offen“); "pruefen": true (ab 0.2.20) ein Dokument im Posteingang; fehlt das Feld oder hat einen anderen Wert, gilt das Dokument als erledigt.

Ab 0.2.43 können in der JSON-Datei zusätzlich "korr_auto": true (Korrespondent automatisch erkannt) und "felder_auto": ["betrag", …] (beim Import eingetragene Felder) stehen – beides Marken, die beim Speichern durch Sie entfallen; ältere Programme ignorieren sie, die Format-Version bleibt 1. konfig\korrespondenten.json enthält die Kennzeichen (fehlt die Datei, gibt es keine).

Seit 0.2.27 liegt zusätzlich konfig\archiv_id.json im Archiv: eine zufällige Kennung, mit der die Sicherung dem Archiv zugeordnet wird (ein weiteres Feld, die Format-Version bleibt 1; ältere Programme ignorieren die Datei).

Die JSON-Datei ist die maßgebliche Quelle. Der Suchindex (SQLite, unter %LOCALAPPDATA%) ist nur ein Zwischenspeicher: Er wird bei Bedarf automatisch aus den JSON-Dateien neu aufgebaut (Menü Verwalten → „Index neu anlegen …“, siehe „Suchindex“). Dateien, die Sie von Hand ändern, werden beim Start bzw. Neuaufbau erkannt. Fremdprogramme können die PDFs jederzeit lesen.

Sicherheit & Datenschutz

  • Der Server lauscht nur auf 127.0.0.1 (nicht im Netzwerk erreichbar) mit zufälligem Port; Zugriff nur mit geheimem Sitzungs-Token (Cookie, SameSite=Strict), Prüfung von Host und Herkunft, Content-Security-Policy.
  • Dokumente, Texte und Einstellungen werden nie ins Internet gesendet; Texterkennung läuft lokal. Einzige Verbindung nach außen: Babierlos-BL fragt höchstens einmal täglich die Versionsdatei babierlos_bl_version.json auf replikant.net ab und überträgt dabei nur seinen Programmnamen und seine Version. Abschalten: Einstellungen → Updates → „Neue Versionen auch auf der Website suchen“.
  • Die Verschlüsselung der abgelegten Dokumente übernimmt Ihre Laufwerksverschlüsselung (BitLocker); Babierlos-BL verschlüsselt selbst nichts.
  • Die Dateien im Archivordner schützt nur Windows (Benutzerrechte, BitLocker) – nicht Babierlos-BL.

Version 0.3.0 „stabil“ – Schutz vor präparierten Dateien

Für 0.3.0 wurde der gesamte Programmcode gezielt auf Angriffsflächen und Fehler geprüft (u. a. mit über 30 000 absichtlich fehlerhaften Anfragen an den Programmserver). Die Bezeichnung „stabil“ heißt: keine neuen Funktionen, nur Absicherung. Korrekturen dazu heißen 0.3.1, 0.3.2 … Die Gefahr geht dabei nicht vom Netz aus (der Server ist von außen nicht erreichbar), sondern von Dateien, die Sie importieren – etwa ein manipulierter Mailanhang.

  • Office-Dateien: LibreOffice läuft mit eigenem Profil, in dem Makros abgeschaltet sind und Verknüpfungen zu anderen Dateien oder Internetadressen nie aktualisiert werden. Ihre eigene LibreOffice-Installation und deren Einstellungen bleiben unberührt.
  • Zip-Bomben: .docx .xlsx .pptx .odt .ods .odp sind gepackte Archive. Ergäbe eine Datei entpackt mehr als 500 MB (oder ein Teil mehr als 200 MB bzw. ist ein großer Teil mehr als 200-fach gepackt), wird sie mit Meldung abgelehnt, bevor LibreOffice sie öffnet.
  • Bilder: Das Bildmodul erkennt das Format am Inhalt, nicht an der Endung. Zugelassen sind nur die Formate, die das Programm braucht (JPEG, PNG, TIFF, BMP, WebP, GIF, HEIC). Eine als .jpg getarnte Datei in einem anderen Format wird abgewiesen.
  • Python-Pakete: Ältere Fassungen von pypdf und Pillow haben bekannte Sicherheitslücken beim Öffnen präparierter PDFs bzw. Bilder. start_babierlos_bl.bat prüft bei jedem Start die Mindestversionen und aktualisiert bei Bedarf. In Einstellungen → Systemprüfung steht ein veraltetes Paket rot als „Veraltet“ mit dem Knopf „Jetzt aktualisieren“. Die EXE enthält die Pakete fest. Deshalb nach jedem Update die EXE neu bauen (build_babierlos_bl.bat aktualisiert die Pakete vorher).
  • Fehlerhafte Anfragen beantwortet der Programmserver mit einer klaren Meldung statt „Interner Fehler“. Zu lange oder ungültige Pfade melden „Das Dateisystem meldet: …“.
  • Stromausfall: Kopien ins Archiv werden vor dem Umbenennen auf den Datenträger geschrieben, damit keine halben Dateien entstehen.

Bewusst nicht geändert: Der Zugangsschlüssel steht beim Start einmal in der Adresse, die das Programm dem Browser übergibt (und damit im Browserverlauf). Er gilt nur bis zum Programmende und nur auf diesem Rechner. Das ist bei einem Einzelplatz-PC vertretbar.

Sicherung – auf USB-Stick, Netzwerkordner oder anderen Ordner (ab 0.2.27)

Das Archiv liegt lokal; eine Festplatte kann ausfallen, ein Dokument kann versehentlich endgültig gelöscht werden. Die eingebaute Sicherung kopiert das Archiv automatisch in einen Ordner Ihrer Wahl. Aufruf: Einstellungen → Reiter „Sicherung“ → „Sicherung einstellen …“ (bis 0.5.2 auch über das Menü Verwalten; oder Klick auf „Gesichert vor …“ in der Statusleiste unten).

Ziel

  • Ordner auf einer lokalen Platte, einem USB-Stick oder im Netzwerk: D:\Sicherung, E:\, \\NAS\Backup\Babierlos oder ein verbundenes Netzlaufwerk.
  • Im gewählten Ordner legt das Programm den Unterordner „Babierlos-Sicherung“ an; andere Dateien im Ordner (etwa auf dem Stick) werden nicht angefasst.
  • Ziel prüfen testet, ob der Ordner erreichbar und beschreibbar ist, wie viel Platz frei ist und ob dort schon eine Sicherung dieses Archivs liegt (der Test legt nichts Dauerhaftes an).
  • Ordner wählen oder anlegen … (ab 0.2.28): zeigt zuerst alle Laufwerke (USB-Sticks, Festplatten, Netzlaufwerke mit freiem Platz); per Klick geht es in die Ordner hinein, „↑ Eine Ebene höher“ zurück. Ein Netzwerkordner lässt sich oben als Pfad eintippen (\\NAS\Backup, Enter). Unter „Neuen Ordner hier anlegen“ entsteht ein neuer Ordner im gerade geöffneten Ordner (ein vorhandener gleichen Namens wird nur geöffnet, nie überschrieben). „Diesen Ordner verwenden“ übernimmt ihn als Ziel und prüft ihn sofort. Dieselbe Auswahl gibt es beim Wiederherstellen.
  • USB-Stick: Windows vergibt nicht immer denselben Laufwerksbuchstaben. Das Programm erkennt die Sicherung an ihrer Kennung und findet sie unter einem anderen Buchstaben wieder. Steckt unter dem alten Buchstaben ein anderer Datenträger, wird nichts darauf kopiert (Meldung); eine neue Sicherung dort legen Sie nur bewusst über „Neue Sicherung auf diesem Datenträger anlegen“ an.
  • Netzwerk: Die Windows-Anmeldung am Netzwerk (NAS, Freigabe) muss bereits bestehen; das Programm speichert keine Zugangsdaten. Antwortet das Ziel nicht innerhalb von 12 Sekunden, gilt es als nicht erreichbar – das Programm bleibt bedienbar.
  • Das Ziel darf nicht im Archivordner liegen (und umgekehrt). Liegt es auf demselben Laufwerk wie das Archiv, warnt das Fenster: Das schützt nicht vor dem Ausfall dieses Laufwerks.

Wann wird gesichert?

Mehrfachauswahl; ohne Haken wird nur von Hand gesichert (Knopf „Speichern und jetzt sichern“).

ZeitpunktVerhalten
Nach jeder ÄnderungDas Programm schaut jede Minute, ob sich im Archiv etwas geändert hat, und sichert, sobald 15 Sekunden lang nichts mehr geschrieben wurde. Nicht während eines Imports.
StündlichEtwa eine Stunde nach der letzten erfolgreichen Sicherung, solange das Programm läuft.
Beim StartEinmal, kurz nachdem das Archiv geöffnet ist.
Beim BeendenWenn Sie das Fenster schließen oder „Babierlos-BL beenden“ wählen: Die Sicherung läuft unsichtbar zu Ende, danach beendet sich das Programm (längstens 15 Minuten). Ein Neustart währenddessen ist möglich.

Was passiert, wenn das Ziel nicht erreichbar ist?

Ihr Archiv bleibt unverändert, es wird nichts kopiert – und das Programm meldet es deutlich (ab 0.2.28):

  • Während das Programm läuft (von Hand, beim Start, stündlich, nach Änderungen): rote Meldung oben im Fenster mit Knopf „Sicherung öffnen“ – einmal je Fehlversuch – und dauerhaft „Sicherung fehlgeschlagen“ in der Statusleiste. Automatische Versuche wiederholen sich frühestens nach 15 Minuten.
  • Beim Beenden: Das Programmfenster ist dann schon geschlossen. Deshalb erscheint ein Windows-Meldungsfenster („Babierlos-BL – Sicherung“) mit dem Grund, z. B. „Sicherungsziel nicht erreichbar … USB-Stick eingesteckt?“. Ebenso, wenn einzelne Dateien nicht gesichert werden konnten oder die 15 Minuten nicht reichten. Beim nächsten Start erscheint die Meldung zusätzlich im Programmfenster. (Das Meldungsfenster schließt sich nach 10 Minuten ohne Klick von selbst, damit das Programm sich beenden kann.)
  • Liegt die letzte erfolgreiche Sicherung mehr als 3 Tage zurück, weist das Programm beim Öffnen darauf hin.

Der Standard-Zeitpunkt ist „Beim Beenden“.

Was genau passiert?

  • Es werden nur neue oder geänderte Dateien kopiert. Jede Datei wird über eine temporäre Datei geschrieben, die Größe geprüft und eine Prüfsumme (SHA-256) in sicherung.json vermerkt. Ändern sich nur Zeitstempel (z. B. durch Proton Drive), wird der Inhalt verglichen und nicht neu kopiert.
  • Die Sicherung ist ein Spiegel mit normalen Dateien (dokumente, originale, konfig) – auch ohne das Programm lesbar. JSON-Dateien werden zuletzt kopiert.
  • Nichts wird endgültig überschrieben oder gelöscht: Was im Archiv geändert, umbenannt oder endgültig gelöscht wurde, liegt in der Sicherung zunächst im Ordner _alt\<Datum_Uhrzeit> und wird nach der eingestellten Aufbewahrungszeit entfernt. Einstellung im Fenster: „Ersetzte und gelöschte Dateien im Unterordner „_alt“ aufbewahrt für … Tage“ – die Zahl sind Tage, keine Anzahl von Sicherungen (Standard 30, 0 = nie entfernen). Gezählt wird ab dem Tag, an dem eine Datei nach _alt kam; aufgeräumt wird nur am Ende einer erfolgreichen Sicherung. Die Sicherung selbst (der Spiegel aller aktuellen Dateien) wird nie nach Zeit gelöscht – auch nicht, wenn wochenlang nicht gesichert wurde. Einziges Risiko: Ein versehentlich gelöschtes Dokument, das Sie erst nach Ablauf der Tage vermissen, ist auch in der Sicherung nicht mehr da; wer das ausschließen will, stellt 0 ein. So lässt sich auch ein versehentlich endgültig gelöschtes Dokument noch zurückholen: Dateien aus _alt zurück ins Archiv kopieren und im Programm „Index neu anlegen“.
  • Platzbedarf: Die Sicherung ist ein Spiegel – jede Datei liegt dort genau einmal; unveränderte Dateien werden nie erneut kopiert und nicht vervielfacht. Hinzu kommt nur, was im Aufbewahrungszeitraum geändert oder gelöscht wurde (bei Änderungen an Tags, Titel usw. ist das meist nur die kleine JSON-Datei). Beispiel: Archiv 2 GB, normale Nutzung → Ziel gut 2 GB, nicht 30 × 2 GB. Viel Platz in _alt belegen nur endgültig gelöschte große Dokumente – und auch die nur bis zum Ablauf der Tage.
  • Der Ordner Babierlos-Sicherung gehört dem Programm: Dateien darin, die nicht aus dem Archiv stammen (auch Reste nach einem harten Abbruch, etwa Stromausfall während der Sicherung), werden beim nächsten Lauf nach _alt verschoben – nichts wird gelöscht. Eigene Dateien bitte nicht dort ablegen.
  • Sicherheitsbremse: Enthält das Archiv plötzlich weniger als die Hälfte der gesicherten Dateien (beschädigt, falsches Laufwerk, Massenlöschung), wird nichts getan und gemeldet. Sind Sie sicher, wählen Sie „Trotzdem sichern“.
  • Das Archiv wird nur gelesen. Einzige Ausnahme: die Kennung konfig\archiv_id.json, die beim ersten Sichern angelegt wird.
  • Reicht der Platz im Ziel nicht, wird vorher abgebrochen. Fällt das Ziel während der Sicherung aus, bleibt das bisher Kopierte erhalten und der nächste Lauf macht weiter. Einzelne nicht kopierbare Dateien (z. B. vom Virenscanner gesperrt) stoppen die Sicherung nicht; sie erscheinen in einer Liste und werden beim nächsten Lauf erneut versucht.

Prüfen und Wiederherstellen

  • Sicherung prüfen liest jede gesicherte Datei erneut und vergleicht die Prüfsumme; es zeigt fehlende und beschädigte Dateien sowie die Zahl der noch nicht gesicherten Änderungen. Bei großen Archiven dauert das einige Minuten.
  • Wiederherstellen … kopiert die Sicherung in einen neuen oder leeren Ordner und prüft jede Datei gegen ihre Prüfsumme; das laufende Archiv wird nie überschrieben. Anschließend bietet das Programm an, dieses Archiv zu verwenden (der Suchindex wird dabei neu aufgebaut). Die Sicherung wird danach mit dem wiederhergestellten Archiv fortgesetzt, ohne alles erneut zu kopieren.
  • Machen Sie einmal einen Probelauf der Wiederherstellung – eine Sicherung, die nie zurückgespielt wurde, ist nicht erprobt.

Hinweise

  • Die Sicherung enthält alle Dokumente unverschlüsselt. Einen USB-Stick bitte mit BitLocker To Go verschlüsseln (Explorer: Rechtsklick auf das Laufwerk → „BitLocker aktivieren“) und nicht verlieren; für ein NAS gilt dessen Zugriffsschutz.
  • Ein Ziel im Cloud-Sync-Ordner (z. B. Proton Drive) ist technisch möglich, schützt aber nicht vor Fehlern, die mitsynchronisiert werden – siehe „Datensicherung von Hand“. Mehrere Rechner (PC und Laptop) bitte in getrennte Zielordner sichern; eine Sicherung gehört zu genau einem Archiv, ein fremdes Archiv wird nicht überschrieben (Meldung).
  • Dateisystem des Sticks: FAT32 nimmt keine Dateien über 4 GB auf (betrifft nur sehr große Originale); exFAT oder NTFS sind besser.
  • Protokoll: %LOCALAPPDATA%\Babierlos-BL\babierlos.log; Zustand der letzten Sicherung: sicherung_status.json im selben Ordner.

Datensicherung von Hand

Seit 0.2.27 übernimmt das die eingebaute Sicherung. Von Hand geht es weiterhin: Der gesamte Archivordner (dokumente, originale, konfig) ist die Datensicherung – eine Kopie auf NAS/USB-Platte genügt. Der Suchindex muss nicht gesichert werden. Ein Archiv im Cloud-Sync-Ordner ist keine Sicherung – Löschungen und Fehler werden mitsynchronisiert. Sichern Sie in regelmäßigen Abständen auf ein getrenntes Medium und prüfen Sie einen Rückspielversuch.

Grenzen dieser Version (0.6.3 „stabil“)

  • Office-Import: automatische Datumsfelder werden bei .odt .ods .odp .docx .xlsx .pptx .rtf .doc festgeschrieben; bei .xls nur Zellen mit genau =HEUTE(), bei .ppt gar nicht (dort ist kein Datum gespeichert) – in diesen Fällen zeigt das PDF das Umwandlungsdatum (das Dokumentdatum im Archiv wird trotzdem aus Eigenschaften/Dateidatum bestimmt). Die .doc/.xls-Bearbeitung ist nur mit von LibreOffice erzeugten Testdateien geprüft, sowie für Word 6 mit einer echten Datei aus der öffentlichen Testsammlung von Apache POI (1997), nicht mit Word-97-Dateien aus Microsoft Word und nicht mit Excel-Dateien aus Microsoft Excel. Ältere Formate (Word für Windows 2.0) werden nicht bearbeitet.
  • Sicherung: nur in einer Richtung (Archiv → Ziel), keine Verschlüsselung durch das Programm, kein Zeitplan nach Uhrzeit (nur die genannten Zeitpunkte), außerhalb des Programmfensters nur das Windows-Meldungsfenster nach einer gescheiterten Sicherung beim Beenden (keine E-Mail o. Ä.). Pfade über 259 Zeichen und Netzwerkziele mit zeitweisen Aussetzern können einzelne Dateien scheitern lassen (Liste im Fenster). Ungetestet unter Windows: Laufwerksliste, Ordnerauswahl auf Laufwerken/Netzwerkpfaden, Windows-Meldungsfenster beim Beenden, USB-Stick mit wechselndem Buchstaben, UNC-Pfade und Netzlaufwerke, Sicherung beim Beenden mit unsichtbarem Fenster.
  • Einzelplatz; kein Abgleich zwischen zwei PCs (nicht umgesetzt; Einstellungen lassen sich übertragen, das Archiv nicht). Ein Archiv gleichzeitig auf zwei Rechnern zu öffnen (z. B. über einen Sync-Ordner) wird nicht unterstützt.
  • Tags werden nur aus den genannten Feldern gelesen; Outlook-.msg wird nicht importiert. Geschützte PDF-Metadaten oder ungewöhnlich kodierte Felder können unlesbar sein – dann bleibt der Tag einfach aus.
  • Der Bildfilter erkennt Größenvarianten nur über den Dateinamen-Zusatz (-BREITExHÖHE) plus Bildvergleich; andere Namen schlägt nur der Aufräum-Assistent vor (nie automatisch). Ob ein Bild „nutzlos“ ist, kann das Programm nicht beurteilen – deshalb gibt es die Mindestgröße und die Bestätigung im Assistenten.
  • Quellabgleich: Eine in der Quelle nachbearbeitete Datei hat einen anderen Inhalt und erscheint daher unter „Quelle verändert“ (nie automatisch gelöscht). Der Abgleich sieht nur die angegebenen Ordner; Dokumente aus nicht angegebenen Quellen sind „nicht mehr vorhanden“, solange die Option „auch ohne/mit anderem Quellpfad prüfen“ an ist. Gespeicherte Quellpfade gelten für den Rechner, auf dem importiert wurde.
  • Posteingang: Der Status wird nur beim Import gesetzt; es gibt keine Regel, die Dokumente selbst als erledigt markiert. Der Haken „Zu prüfen“ fällt bei jeder Änderung im Dokument weg – auch bei einer versehentlichen (wieder anhaken, solange noch nicht gespeichert). Ältere Dokumente (vor 0.2.20) sind erledigt und lassen sich nur über „Zu prüfen“ nachträglich in den Posteingang legen. Duplikate werden nicht erneut angelegt und kommen deshalb auch nicht in den Posteingang.
  • Eigene Felder: Werte werden nur bei Rechnungen/Mahnungen mit eindeutigem Ergebnis beim Import eingetragen (ab 0.2.43, markiert); sonst gibt es für Betrag und Fälligkeit Vorschläge zum Anklicken (ab 0.2.30, nur Heuristik, siehe „Fälligkeit & Erinnerungen“). Erinnerungen erscheinen nur im Programmfenster (keine Benachrichtigung von außen, keine Werktags-/Feiertagsrechnung). Summen werden auf Cent gerundet. Beim Teilen erhalten weitere Teile keine Feldwerte.
  • Die Einstellung „Größe“ nutzt die CSS-Eigenschaft zoom (Chromium/Chrome/Edge; Firefox ab Version 126). Der Zoom des Browsers selbst bleibt zusätzlich möglich und multipliziert sich mit ihr.
  • CSV-/Text-Import und Mailtext (ab 0.2.33): Die PDF-Darstellung ist reiner Text in Schreibmaschinenschrift (keine Tabellenansicht, Formatierung und Bilder von HTML-Mails gehen verloren, Zeichen außerhalb Windows-1252 erscheinen als „?“); Original (CSV bzw. .eml) und Volltextsuche bleiben vollständig. .txt-Dateien werden nur als Mail-Anhang importiert, nicht aus Ordnern. Enthält eine Mail PDF-Anhänge und Text, wird nur der Anhang archiviert (nicht der Mailtext).
  • RegEx-Hilfe: Es gilt die Python-Schreibweise; das Testfeld prüft nur den eingefügten Beispieltext (bis 20 000 Zeichen). Die Trefferzahl im Archiv betrachtet den erkannten Text ohne Dateinamen und bricht nach 8 Sekunden ab. Ein extrem aufwendiges Muster wird nach dem Zeitlimit samt Hilfsprozess beendet; es rechnet nichts weiter. Ausnahme: bereits gespeicherte Regeln mit solchem Muster werden beim Import weiterhin ohne Zeitlimit angewendet.
  • Dokumenttyp lernen (ab 0.2.40): Die Sicherheitsschwelle und die erwartete Trefferquote sind Schätzungen aus Ihren eigenen bestätigten Dokumenten (mindestens 30 nötig). Bei den ersten Importen nach dem Einschalten kann sich die Schwelle noch verschieben. Typen mit weniger als 3 bestätigten Dokumenten werden nicht gelernt.
  • Korrespondent erkennen (ab 0.2.43): erkennt nur Namen, die Sie schon einmal vergeben haben, oder deren Kennzeichen – einen ganz neuen Absender muss man einmal von Hand eintragen. Steht der Name nur tief im Text oder stehen zwei Namen gleich stark da, wird nichts eingetragen. Die Messwerte (61 richtig, 0 falsch) stammen aus einem Archiv mit vielen Zeitschriftenartikeln; bei vielen Briefen mit Absenderzeile im Kopf ist mit Verwechslungen zu rechnen, wenn ein Korrespondent im Kopf eines fremden Briefs genannt wird (z. B. Ihre Bank in einem Brief des Finanzamts) – deshalb die Marke „bitte prüfen“ und die Selbstkontrolle.
  • Themen-Vorschläge (ab 0.2.43): nur Vorschläge, nie automatisch; erster Vorschlag in rund zwei Dritteln richtig.
  • Betrag/Fälligkeit vorbelegen (ab 0.2.43): heuristisch wie die Vorschläge; nur Euro-Beträge in deutscher Schreibweise, keine Werktags-/Feiertagsrechnung. Die Fälligkeit wird nur bei ausdrücklicher Angabe eingetragen.
  • Scanner-Text prüfen (ab 0.2.41): Die Textqualität ist ein Näherungsmaß ohne Wörterbuch. Sehr fachsprachliche Texte, Programmcode oder Tabellen mit vielen Abkürzungen können niedriger bewertet werden, als sie sind; Zeichensalat, der zufällig wie Wörter aussieht, höher. Die Grenzwerte (50 % / 85 %) sind an einem echten Archiv geeicht. Die Ausrichtungserkennung braucht die Datei osd.traineddata (gehört zum üblichen Tesseract-Installer); ohne sie wird nur bei unbrauchbarem Ergebnis durch Ausprobieren gedreht. „Texterkennung neu“ macht aus Seiten mit echtem Text ein Bild mit unsichtbarem Text (Original bleibt). Ungetestet: Texterkennung mit dem deutschen Sprachpaket unter Windows (geprüft wurde unter Linux mit dem englischen Sprachpaket an echten Scans).
  • Einstellungen übertragen (ab 0.2.41): Das „Speichern unter“-Fenster gibt es nur in Chromium/Chrome/Edge; Firefox lädt in „Downloads“. Ob Ordner auf dem anderen Rechner existieren, wird nur angezeigt, nicht angelegt.
  • Durchsuchbare PDF, kein PDF/A, keine revisionssichere Archivierung.
  • Outlook .msg und andere nicht genannte Formate werden nicht importiert. Office-Dateien nur mit installiertem LibreOffice; Makro-Formate (.docm, .xlsm) nie. Das PDF zeigt das Dokument so, wie LibreOffice es darstellt (Schriften, Seitenumbruch können vom Original abweichen). Die Office-Umwandlung ist nur unter Linux getestet, nicht unter Windows und nicht mit Word-Dateien aus echter Praxis (Makros, Kennwortschutz, riesige Tabellen).
  • Kennwortgeschützte PDFs werden abgewiesen. Sehr schlechte Scans, Handschrift und Tabellen werden von OCR nur mäßig erkannt – bitte Ergebnisse stichprobenartig prüfen.
  • Die Vorschau nutzt den PDF-Betrachter des Browsers; für ein anderes Programm dient „Im System-Viewer“.
  • Entwickelt und automatisch getestet wurden Kern, Server und Oberfläche unter Linux/Chromium; die vollständige Testreihe (über 700 Tests) läuft auch unter Windows (run_test.bat) und hat dort bestanden, ebenso ein Praxistest mit EXE, „Mit Windows starten“, Symbol im Infobereich und HEIC-Fotos. Nicht in der Praxis geprüft sind u. a. Netzwerk- und UNC-Ziele der Sicherung sowie die Office-Umwandlung mit Dateien aus Microsoft Office. Bitte melden Sie Auffälligkeiten; die Protokolldatei %LOCALAPPDATA%\Babierlos-BL\babierlos.log hilft bei der Fehlersuche.

Ausblick

  • 0.6.3 (09.10.2026): Handbuch: Die Abfrage nach neuen Versionen ist jetzt als einzige Internetverbindung des Programms genannt (bisher hieß es „kein Internetzugriff“); ein Beispiel-Dateiname enthält keinen echten Rechnernamen mehr. Programmverhalten unverändert.
  • 0.6.2 (09.10.2026): Dokumentation und Beispiele ohne persönliche Angaben (Beispielpfade, Ortsnamen, Entwicklungsnotizen) – Vorbereitung der Veröffentlichung. Programmverhalten unverändert.
  • 0.6.1 (09.10.2026): Korrekturen: pillow-heif (HEIC-Fotos) wird beim Bau in die EXE eingebaut, die Systemprüfung der EXE zeigt keinen irreführenden pip-Befehl mehr; nach „Beenden“ am Symbol im Infobereich schließt sich das Programmfenster selbst statt „Failed to fetch“ zu melden.
  • 0.6.0 „stabil“ (09.10.2026): Stand von 0.5.4, unter Windows vollständig geprüft (alle Tests und der Praxistest „Mit Windows starten“). Ab hier nur Fehlerkorrekturen: 0.6.1, 0.6.2 … Neue Funktionen bekommen eine neue Versionsreihe.
  • 0.3.x: nur Fehlerkorrekturen zur Version „stabil“ (0.3.1, 0.3.2 …), keine neuen Funktionen.
  • 0.4.0: Symbol im Infobereich, „Mit Windows starten“, Programmversion im Dateinamen beim Einstellungs-Export. Korrekturen dazu: 0.4.1, 0.4.2 …
  • 0.5.4: Abgelehnte Uploads melden unter Windows wieder ihren Grund statt eines Verbindungsabbruchs.
  • 0.5.3: Programmstart: verständliche Anzeige, welche Fassung Windows startet und welche gerade läuft.
  • 0.5.2: „Ziel prüfen“ der Sicherung lehnt unvollständige Pfade ab; Tests öffnen keine Meldungsfenster mehr.
  • 0.5.1: Korrektur nach dem ersten Testlauf unter Windows (Umbenennen nur der Schreibweise).
  • 0.5.0: Hinweis auf neue Versionen (Update-Ordner und Versionsdatei der Website), nur melden, nie selbst installieren.
  • Nicht umgesetzt (Entscheidung 08.10.2026): Abgleich des Archivs zwischen PC und Laptop (Änderungspaket mit Löschmarken). Die Löschmarken im Archivformat bleiben dafür vorbereitet.
  • Später: Mehrplatz-Betrieb (Benutzer, Rechte), weitere Formate, Benachrichtigungen außerhalb des Programmfensters (z. B. E-Mail), wiederkehrende Fälligkeiten.

Fehlersuche

ProblemLösung
Nach einem Update zeigt das Programm Fehler oder alte MeldungenVermutlich lief noch die alte Version. Ab 0.2.2 ersetzt der Start eine ältere laufende Version automatisch. Von einer Version vor 0.2.2 aus: im Programm im Menü Hilfe „Babierlos-BL beenden“ wählen (oder Task-Manager: Python beenden), dann neu starten.
Neu importierte Dokumente haben keinen Typ (ab 0.2.40)Gewollt, wenn das Programm nicht sicher genug war: Im Dokument stehen unter „Dokumenttyp“ Vorschläge zum Anklicken. Wie viel es schon gelernt hat und ab wann es den Typ selbst setzt, steht unter Einstellungen → Dokumenttyp beim Import. Mit der Sammelaktion „Typ“ gesetzte oder gespeicherte Typen machen das Programm mit der Zeit sicherer.
Fenster öffnet nicht im gewünschten Browser / nur als TabStatusleiste „Fenster: …“ und Systemprüfung ansehen: dort steht, welche Browser gefunden wurden. Fehlt Chromium, unter Einstellungen den Pfad zur chrome.exe eintragen und Programm neu starten.
Start bricht ab / Fenster erscheint nichtstart_babierlos_bl.bat --check ausführen (zeigt fehlende Pakete/Tesseract). Danach babierlos.log ansehen.
„Zugriff verweigert“ im BrowserProgramm nur über Start-Datei öffnen, nicht die Adresse aus einem alten Lesezeichen verwenden (der Zugangsschlüssel ändert sich bei jedem Start).
Dokument hat das heutige Datum statt des ursprünglichenAb 0.2.22 gilt: Datum im Text → Dokumenteigenschaften → (ab 0.2.36: Datum im Dateinamen →) Änderungsdatum der Datei. Ein automatisches Datumsfeld im Brief zeigte bis 0.2.23 im PDF das Umwandlungsdatum; ab 0.2.23 wird es festgeschrieben, ab 0.2.24 auch bei .doc, ab 0.2.25 auch in Textfeldern, ab 0.2.26 auch bei Word 6/95 (bei .xls nur =HEUTE(), bei .ppt nicht möglich, siehe „Datum von Office-Dokumenten“) – sonst lässt sich das Datum über „Datum“ korrigieren. Frühere Importe: Datum von Hand ändern. Importiert vor 0.2.22 hochgeladene Dateien ohne Datum im Text trugen das Upload-Datum.
Office-Datei wird abgelehnt: „LibreOffice nicht gefunden“LibreOffice installieren (Download-Seite), danach den Import wiederholen (kein Neustart nötig). Liegt es an ungewöhnlicher Stelle: Einstellungen → Office-Dateien → Pfad zu soffice.exe. Stand: Systemprüfung.
Office-Datei: „LibreOffice konnte die Datei nicht in PDF umwandeln“ / „hat nicht geantwortet“Datei in Word/LibreOffice öffnen (kennwortgeschützt? beschädigt?) und als PDF speichern, dann die PDF importieren. Bei sehr großen Dateien ggf. mehrfach versuchen; Protokoll: babierlos.log.
Gescannte Rechnung: kein Betragsvorschlag, Titel aus seltsamen Zeichen, Suche findet nichts (bis 0.2.40)Die PDF enthielt eine unbrauchbare Textebene des Scanners. Ab 0.2.41 erkennt der Import das selbst. Ältere Dokumente: Verwalten → Schlechte Texterkennung finden oder im Dokument „Text neu erkennen“ / „Texterkennung neu“. Siehe Scanner-Text prüfen.
Einstellungen auf dem Laptop sind anders als auf dem PCEinstellungen → Exportieren auf dem einen, Importieren auf dem anderen Rechner (siehe Einstellungen übertragen).
Systemprüfung zeigt ein Paket als „Veraltet“ (ab 0.3.0)Python-Version: auf „Jetzt aktualisieren“ klicken oder start_babierlos_bl.bat neu starten (aktualisiert selbst; Internet nötig), danach Programm neu starten. Von Hand: py -m pip install --upgrade -r requirements.txt. EXE-Version: mit build_babierlos_bl.bat neu bauen.
Office-Datei wird abgelehnt: „… würde entpackt … MB ergeben bzw. ist ungewöhnlich stark gepackt“ (ab 0.3.0)Schutz vor manipulierten Dateien. Ist die Datei echt (z. B. eine riesige Tabelle), in Word/LibreOffice/Excel öffnen, als PDF speichern und die PDF importieren.
Scans nicht durchsuchbarTesseract installieren, Einstellungen/Systemprüfung prüfen, dann Dokumente markieren → „Texterkennung nachholen“.
Schlechte Erkennung von UmlautenSprachpaket „German“ (deu) im Tesseract-Installer nachinstallieren.
Es werden keine Tags aus der Datei übernommenEinstellung „Tags beim Import aus der Datei übernehmen“ prüfen; in Word/Acrobat müssen die Schlüsselwörter (nicht nur Titel/Betreff) gefüllt sein. Bei Fotos: Explorer → Eigenschaften → Details → Tags. Für schon importierte Dokumente „Tags aus Datei“ verwenden.
Link zum Download funktioniert nicht mehrDie Tabelle unter „Installation“ verweist auf die jeweilige Hauptseite; dort steht immer die aktuelle Fassung.
Quellabgleich zeigt fast alles als „nicht mehr vorhanden“Meist fehlt ein Quellordner in der Liste (alle Ordner angeben, aus denen importiert wurde – ein Ordner je Zeile) oder ein falscher Ordner (Warnung beachten), Laufwerk getrennt oder die Dokumente stammen aus einer anderen Quelle. Nichts auswählen, Ordner prüfen und den Abgleich wiederholen.
Links steht „Posteingang 1“, die Liste ist aber leerMeist steht noch ein Suchbegriff im Suchfeld: Die Zahl links zählt alle Dokumente im Posteingang, die Liste zeigt nur die, die zum Suchbegriff passen. Ab 0.2.42 steht der Suchbegriff als Kästchen „Suche: …“ über der Liste, und bei leerer Liste erscheint „Suchbegriff entfernen“.
Der Posteingang ist leer, obwohl ich importiert habePrüfen, ob die Herkunft des Imports unter Einstellungen → Posteingang angehakt ist (Ordnerimport standardmäßig nicht), ob die Dateien als „Duplikat“ erkannt wurden (unter Aufträge) und ob die Einstellung erst nach dem Import geändert wurde (wirkt nicht rückwirkend). Vorhandene Dokumente: auswählen → „Zu prüfen“.
Ein Dokument verschwindet beim Speichern aus der ListeIm Posteingang gewollt: Speichern = erledigt. Soll es bleiben, vor dem Speichern den Haken „Zu prüfen“ (oben rechts im Dokument) wieder setzen oder später Auswahl → Zu prüfen; „Rückgängig“ geht ebenfalls.
„Metadaten-Datei des Dokuments fehlt im Archiv.“Fehler bis 0.2.41 nach einer Änderung nur der Groß-/Kleinschreibung (z. B. „Amazon“ → „AMAZON“). Ab 0.2.42 behoben und beim Start automatisch repariert; von Hand: Knopf „Prüfen und reparieren …“ in der Meldung oder Verwalten → Archiv prüfen und reparieren. Siehe Archiv prüfen und reparieren.
Ein Korrespondent wurde falsch eingetragen (ab 0.2.43)Im Dokument korrigieren und speichern. Passiert das öfter mit demselben Namen, unter Verwalten → Korrespondent-Erkennung „Nie automatisch“ anhaken; nach drei Fehlgriffen bei Dokumenten, die Sie gespeichert haben, schaltet das Programm den Namen selbst auf „nur vorschlagen“.
Betrag oder Fälligkeit stehen schon drin, ohne dass ich etwas getan habe (ab 0.2.43)Gewollt bei eindeutigen Rechnungen (Marke „automatisch – bitte prüfen“). Abschalten unter Einstellungen → Korrespondent, Betrag und Fälligkeit beim Import.
Suche findet Dokument nichtMenü Verwalten → „Index neu anlegen …“.
„Index-Datei gesperrt, bitte andere Instanz beenden.“Eine zweite (meist ältere) Instanz hält die Index-Datei. Im Task-Manager Python bzw. babierlos_bl beenden und neu starten; danach im Dialog „Erneut versuchen“. Siehe „Suchindex“.
Der Index-Neuaufbau dauert sehr langeFortschritt in der Statusleiste beobachten. Gibt es lange keinen Fortschritt: im gelben Hinweis „Index neu anlegen“. Danach babierlos.log ansehen (Zeiten für Einlesen/Schreiben); Virenscanner-Ausnahme für den Archiv- und den Index-Ordner kann helfen.
Die Oberfläche ist zu groß / die Liste unübersichtlichMenü Ansicht: „Größe 80 %“ oder „90 %“ und/oder „Liste: kompakt“; bei zu vielen Chips „Tags in der Liste anzeigen“ abschalten.
Das Suchfeld oben ist sehr schmal (ab 0.2.32 behoben)Das Suchfeld hat jetzt mindestens 240 Pixel; bei schmalen Fenstern (unter ca. 1560 Pixel Breite) zeigen die Knöpfe nur noch Symbole mit Hinweistext, und die Kopfleiste bricht bei Bedarf in eine zweite Zeile um.
Ein neu importiertes Dokument erscheint nicht (oder spät) in „Alle Dokumente“Ab 0.2.35 aktualisiert sich die Liste nach jedem Import selbst (bis 0.2.34 galt das nicht für den ersten Import nach dem Programmstart). Ist es dennoch nicht zu sehen: Es steht nach seinem Dokumentdatum in der Liste (Sortierung „Datum“) – Seitenleiste Neu importiert oder Sortierung „Zuletzt importiert“ wählen.
Eine .eml landet im Eingangsordner in _fehler (bis 0.2.32)Ursache: Die Mail hatte keinen PDF-/Bild-/Office-Anhang (z. B. nur Text oder eine CSV-Datei) oder der Anhang hatte keinen Dateinamen/keine Endung. Ab 0.2.33: CSV-/Text-Anhänge werden importiert, Anhänge ohne Namen anhand ihres Inhalts erkannt, und eine Mail ohne verwertbaren Anhang wird als Mailtext archiviert. Es bleibt ein Fehler bei einer völlig leeren Mail oder einem nicht erkannten Anhang (ab 0.2.34 für jeden solchen Anhang, z. B. .zip oder .msg – auch wenn andere Teile der Mail importiert wurden; die Mail geht dann zur Kontrolle nach _fehler; Signaturdateien .p7s/.asc/.sig sind ausgenommen). Die Meldung steht in Aufträge.
Import wird als „Fehler“ gemeldetMeldung in Aufträge lesen (z. B. Datei beschädigt, kennwortgeschützt, .msg).
Nach dem Ändern nur der Groß-/Kleinschreibung (z. B. Korrespondent „Amazon“ → „AMAZON“) behält die PDF-Datei den alten Namen; „Archiv prüfen und reparieren“ meldet bei jedem Start dieselben Dateinamen (bis 0.5.0)Fehler bis 0.5.0, nur unter Windows: Das Programm übernahm beim Zusammensetzen des Dateinamens die Schreibweise der schon vorhandenen Datei, das Umbenennen lief deshalb ins Leere. Daten gingen dabei nicht verloren. Ab 0.5.1 behoben; beim ersten Start werden die betroffenen Dateinamen automatisch angeglichen (sichtbar unter Verwalten → Archiv prüfen und reparieren).
Eine neue Version wird nicht gemeldet (ab 0.5.0)Einstellungen → Updates ansehen: Ist der Update-Ordner richtig und heißt die Datei genau Babierlos-BL_vX.Y.Z.zip (z. B. Babierlos-BL_v0.5.1.zip, oberste Ebene des Ordners)? „Jetzt prüfen“ drücken. Wurde die Version mit „nicht mehr melden“ unterdrückt, steht dort „Wieder melden“.
Kein Symbol im Infobereich (ab 0.4.0)Pfeil „^“ neben der Uhr öffnen – Windows blendet neue Symbole oft dort aus; per Ziehen in die Taskleiste dauerhaft sichtbar machen (Windows 11: Einstellungen → Personalisierung → Taskleiste → Weitere Symbole der Taskleiste). Steht im Protokoll „Infobereich nicht verfügbar“, bitte die Zeile melden.
Babierlos-BL startet nicht mit Windows (ab 0.4.0)Einstellungen → Programmstart ansehen: „In Windows ausgeschaltet“ → Haken aus- und wieder einschalten; „Programm nicht gefunden“ → Haken aus- und wieder einschalten; „startet nicht das Programm, das gerade läuft“ → „Das laufende Programm eintragen“. Die EXE nach dem Einschalten nicht mehr verschieben.
Windows-Firewall fragtNicht nötig – Babierlos-BL nutzt nur die lokale Schleife; „Abbrechen/Blockieren“ ist unbedenklich.

Autor, Copyright, Haftung

Autor: Bernhard Lickert, entwickelt mit Claude (Anthropic) · Copyright © 2026 · Version 0.6.3 „stabil“

Die Nutzung dieses Programms erfolgt ausschließlich auf eigene Gefahr. Der Autor und Claude (Anthropic) übernehmen keinerlei Haftung für Schäden, Datenverluste, fehlerhaft erkannte Texte, falsch zugeordnete Dokumente oder sonstige Folgen der Nutzung – gleich welcher Art. Das Programm ersetzt weder eine Datensicherung noch eine rechtssichere (revisionssichere) Archivierung; gesetzliche Aufbewahrungsfristen und Sicherungen liegen in der eigenen Verantwortung des Nutzers. Originaldokumente sollten erst vernichtet werden, wenn die digitale Fassung geprüft und gesichert ist.