---
name: health-data-management
description: Gesundheitsdaten-Verwaltungssystem — JARVIS verwaltet alle Gesundheitsdaten (Laborwerte, Dokumente, Symptome, Auswertungen)
version: 2.0.0
tags: [health, database, pdf, camelot, watchdog, statistics]
---

# Health Data Management — Chief Medical Data Officer

## Übersicht

Alle Gesundheitsdaten unter `~/.hermes/assets/Gesundheit/`.
241 Laborwerte, 59 Dokumente (9 mit extrahiertem Volltext), 244 Events, 3 Medikamente.
Master-Datenbank: `health_data.db` mit 13 fachlichen Tabellen plus SQLite-intern `sqlite_sequence` (Stand Prüfung 2026-05-12); `processing_log` ist in der aktuellen DB nicht vorhanden.

**Docling-Reprocessing:** 50 von 59 Dokumenten haben keinen durchsuchbaren Volltext. Siehe `references/docling-reprocessing-workflow.md` für den Bearbeitungsplan.

## Verzeichnisstruktur

```
Gesundheit/
├── health_data.db          # Master-Datenbank (12 Tabellen)
├── inbox/                  # Neue Dokumente (Watchdog überwacht)
├── processed/              # Verarbeitete Dokumente
├── archiv/                 # Alle Dokumente kategorisiert
│   ├── laborberichte/
│   ├── klinische_befunde/
│   ├── medikamente/
│   ├── krankheitsgeschichte/
│   ├── wearables/
│   ├── ernaehrung/
│   └── sonstiges/
├── reports/                # Generierte Reports (PNG, HTML)
├── scripts/                # Verarbeitungs-Skripte
│   ├── health_manager.py       # Haupt-Manager (CRP, Korrelationen, Dashboards)
│   ├── health_watchdog.py      # Daemon für automatische PDF-Verarbeitung
│   ├── health_watchdog.sh      # Start/Stop/Status Wrapper
│   └── verify_system.py        # System-Verification
├── backup_original/        # FRIDAY-Backup (62 Dateien)
└── logs/                   # Watchdog-Logs
```

## Datenbank-Schema (13 fachliche Tabellen + `sqlite_sequence`)

1. **laborwerte** — 241 Laborwerte (aktuell, Stand Mai 2026)
2. **health_events** — 244 Events
3. **dokumente** — 59 Dokumente (Stand Mai 2026), mit CHECK constraints: `status IN ('neu','eingearbeitet','archiviert')`, `daten_typ IN ('pdf','image')`
4. **medikamente** — 3 Medikamente
5. **dokumente_status** — Status-Tracking
6. **symptome** — Symptom-Stammdaten
7. **symptom_log** — Symptom-Tagebuch
8. **vitalzeichen** — Blutdruck, Puls, Temperatur
9. **arztbesuche** — Arztbesuche
10. **ernaehrung** — Ernährungsdaten
11. **tagebuch** — universelle Tagebuch-/Gesundheitseinträge
12. **korrelationen** — Korrelationen/Analysen
13. **auswertungen** — Generierte Reports

Hinweis: `sqlite_sequence` ist eine SQLite-interne Tabelle. `processing_log` existiert im aktuellen Schema nicht, obwohl ältere Notizen sie erwähnen.

**Pitfall:** Nur 9 von 59 Dokumenten haben `extrahierte_inhalte` (Volltext) in der Datenbank — diese sind durchsuchbar. 50 Dokumente haben keinen extrahierten Text. Docling-Reprocessing empfohlen (siehe unten).

## Workflow

### Dokumenten-Klassifizierung (KRITISCH)

**Arztbericht** (Ambulanter Bericht, Konsultation, Visitenbericht):
- Kategorie: `BEFUNDE`
- Methode: PyMuPDF (fitz) → Volltext extrahieren
- Speicherung: Volltext in `extrahierte_inhalte` für spähere Abfragen
- Metadaten: Dokumentdatum, Behandler, Diagnose als Annotation am Textbeginn
- Datei: `archiv/befunde/`

**Laborbericht** (Blutwerte, Urin, Befunde mit tabellarischen Werten):
- Kategorie: `LABOR`
- Methode: Camelot/pdfplumber → tabellarische Werte extrahieren
- Speicherung: Einzelne rows in `laborwerte` Tabelle
- Datei: `archiv/laborberichte/`

**Sonstiges** (Rezepte, Sonstiges):
- Kategorie: `SONSTIGES`
- Methode: Je nach Inhalt
- Datei: `archiv/sonstiges/`

### Verarbeitungsablauf

1. Dokument → `inbox/` kopieren
2. Dokument-Typ klassifizieren (Arztbericht vs. Laborbericht)
3. **Fallback:** Watchdog-Daemon ist unzuverlässig → manuell verarbeiten mit `health_manager.process_inbox_pdf()`
4. Bei Arztbericht: PyMuPDF Volltext → Datenbank (extrahierte_inhalte)
5. Bei Laborbericht: Camelot/pdfplumber → laborwerte Tabelle
6. Metadaten extrahieren (Datum, Behandler, Diagnose) → im Text annotieren
7. Datenbank-Eintrag erstellen/aktualisieren mit korrekter Kategorie
8. Status auf `eingearbeitet` setzen
9. Datei an korrekten Archiv-Ort verschieben

## Health Manager Subagent

### Haupt-Skript: `health_manager.py`

**Methoden:**
- `get_laborwerte(parameter, start_date, end_date)` — Laborwerte laden (FRIDAY-Schema: `parameter_name`, `ermittlung_datum`)
- `compute_crp_trend()` — CRP-Trend mit scipy (P-Werte)
- `compute_correlations(target_parameter)` — Korrelationsanalyse mit statsmodels
- `generate_plotly_dashboard(output_path)` — Interaktives HTML-Dashboard
- `generate_profiling_report(output_path)` — ydata-profiling HTML-Report
- `generate_heatmap(parameter_list, output_path)` — Heatmap mit matplotlib/seaborn
- `process_inbox_pdf(pdf_path)` — Manuelle PDF-Verarbeitung

### Watchdog-Daemon

```bash
# Starten
bash ~/.hermes/assets/Gesundheit/scripts/health_watchdog.sh start

# Stoppen
bash ~/.hermes/assets/Gesundheit/scripts/health_watchdog.sh stop

# Status
bash ~/.hermes/assets/Gesundheit/scripts/health_watchdog.sh status

# Neustarten
bash ~/.hermes/assets/Gesundheit/scripts/health_watchdog.sh restart
```

### Python-Umgebung

- Skripte laufen unter `/usr/bin/python3.12`
- Alle Pakete: `pip install --break-system-packages`
- Watchdog-PID: `~/.hermes/assets/Gesundheit/health_watchdog.pid`
- System-Verification: `python3.12 scripts/verify_system.py`

## Health Intelligence Workflow (ab 2026-05-12)

- Migration: `scripts/health_system_migrate.py` legt Review-/Staging-/Insight-/Report-Tabellen an und macht vorher ein DB-Backup unter `backups/`.
- `scripts/health_pipeline.py` ist die zentrale Pipeline: `generate-lab-report`, `export-correction`, `import-correction`, `dashboard`, `daily-report`, `weekly-report`, `status`.
- Vollverarbeitung/Datenqualität: `scripts/process_all_health_documents.py` verarbeitet alle Dokumente in `dokumente` mit PyMuPDF/OpenPyXL und Docling-Fallback, aktualisiert `extrahierte_inhalte`, `datei_hash`, `local_original_path`, `document_insights` und markiert Duplikate konservativ als `review_status='duplicate_candidate'` ohne zu löschen. Danach `scripts/link_lab_values_to_documents.py` für konservative Laborwert↔Original-PDF-Verlinkung und `scripts/generate_health_data_quality_report.py` für QA-Bericht ausführen.
- Dashboard v3 (`scripts/health_dashboard_v3.py`) rendert Labortrends stabil ohne Chart.js-Annotation-Plugin: Messlinien, Achsen, Referenzbänder/-Grenzlinien und Health-Event-Marker sind normale Chart.js-Datasets. `health_pipeline.py dashboard` ruft diesen Renderer auf. Die Tabelle „Klinische Events, Medikamente & Symptome“ schliesst routinemässige LABOR/PROFIL/BEFUNDE-Artefakte aus; Laborwerte gehören in die Trendcharts, nicht in die Event-Tabelle. Seit 2026-05-12 enthält das Dashboard zusätzlich Behçet-relevante Charts wie BSG, Differentialblutbild, Fibrinogen, Gesamtcholesterin, Triglyceride, Homocystein, Nieren-/Urinmarker und Leberwerte.
- Dashboard v3 enthält Originaldokument-/PDF-Links via `drive_web_url` oder `file://`, Health-Event-/Symptom-Tabellen, `health_event_periods` für Aphthen/Schübe/Medikationsphasen und `nutrition_daily_features` mit keywordbasierter Ernährungsplan-Treue. Zeitraum-Events können per `scripts/health_add_event_period.py --start YYYY-MM-DD --end YYYY-MM-DD --type Aphte ...` erfasst werden.
- Apple Health Auto Export: iPhone-App auf Google Drive + JSON konfigurieren. Tatsächlicher App-Zielordner nach Testexport: `Health Auto Export` ID `1BPtqp9h72eh5GQZRSszIn-pYKX6AGUaT` (Dateien `HealthAutoExport-2026-19.json`, `HealthAutoExport_jahr-2025.json`, tägliche `HealthAutoExport_jahr-YYYY-MM-DD.json`). Import über `scripts/apple_health_drive_sync.py`; Parser unterstützt `{data:{metrics:[{name,units,data:[...] }]}}` und Schlafwerte via `totalSleep`. Raw/normalisierte Daten liegen in `apple_health_records`, Importdateien in `apple_health_import_files`. Für Berichte/Dashboard niemals Rohwerte direkt summieren: `scripts/apple_health_analytics.py` nutzen. Es dedupliziert überlappende Exporte, wandelt 2025-Wochen-Summen für Sum-Metriken in Tagesäquivalente um und blendet den aktuellen Tag aus, weil der 12h-Sync erst am Folgetag definitive Tageswerte liefert. Täglicher no-agent Cron `bdc03626e17f` läuft 23:45 via `~/.hermes/scripts/apple_health_daily_sync.py` und bleibt still, wenn nichts Neues importiert wurde.
- Arztbericht/PDF: `scripts/generate_doctor_report.py` erzeugt `reports/arztbericht_aktuell.pdf` im Querformat mit automatischem Tabellen-Zeilenumbruch, KPI-Ampelsystem nach Gesundheitsbereich, Gesamtgesundheitsindikator-Liniendiagramm und Apple-Health-Grafiken. Es lädt das PDF in Google Drive Ordner `Gesundheitsberichte` (`1oVpcbpelbt2IwHL9oGw9QTi2haQL63-v`) hoch und schreibt `reports/arztbericht_drive_link.json`. Wichtig: Bericht verwendet nur validierte Laborwerte mit `abnahme_datum`/`befund_datum`; `ermittlung_datum` ist Import-/OCR-Zeitstempel und darf nicht als medizinisches Datum angezeigt werden. Dashboard v3.1 zeigt lokale PDF- und Drive-Links sowie Apple-Health-Module für Schritte, Distanz, Ruhepuls, HRV, Schlaf, SpO₂, Atemfrequenz, Aktivität, Physical Effort und Gewicht.
- Apple Health Auto Export: Für die iPhone-App `Health Auto Export - JSON + CSV` bevorzugt **Google Drive + JSON**. Zielordner: `Gesundheitsdaten Inbox / Apple Health Auto Export` (`1T2kpxRyRyH8mSknXm85RRNFFfex61iWQ`). Lokale Inbox: `inbox/apple_health_exports/`. Import-Skripte: `scripts/apple_health_import.py` und `scripts/apple_health_drive_sync.py`. Details: `references/apple-health-auto-export.md`.
- `scripts/generate_labor_report.py` ist nur noch ein Kompatibilitäts-Wrapper für `health_pipeline.py generate-lab-report`.
- `reports/aktuelle_blutwerte.xlsx` wird im gewünschten Pivot-Format erzeugt: eine Spalte pro Untersuchung/Datum, eine Zeile pro Parameter. Die aktuellste Referenz-XLSX aus `inbox/260510_Laborwerte_Uebersicht.xlsx` wird bevorzugt, weil sie Datums-Spalten bis `2026-05-07` enthält.
- Dashboard: `reports/health_dashboard.html`.
- Workflow-Dokumentation: `reports/health_intelligence_workflow.md`.
- Google Drive Korrektur-Ordner: `Gesundheitsdaten Korrektur` (`18wPP6yHjdp8XShhue7OZcamcqc09ec9g`).
- Cron Scripts: `~/.hermes/scripts/health_daily_sync.py` (täglich 23:10), `~/.hermes/scripts/yazio_sync.py` (YAZIO-Ernährungsimport täglich 23:15, Job `b9eb80891aa4`), `~/.hermes/scripts/health_weekly_report.py` (sonntags 18:00) und `~/.hermes/scripts/weekly_health_drive_backup.py` (verschlüsseltes Health/Hermes-Backup sonntags 23:55, Job `04918ca83019`). Alter fehlerhafter Inbox-Cron `e2150e5d908d` ist pausiert; neue Jobs: `2bf4d0a8bedb`, `e9b6fe32c177`. YAZIO-Sync schreibt idempotent in `ernaehrung` und `tagebuch`, prüft heute und gestern und bleibt still, wenn nichts geändert wurde. Weekly Backup nutzt GPG AES256 mit Passphrase-Datei `~/.hermes/backup_keys/health_weekly_gpg_passphrase.txt`, Google-Drive-Ordner `Hermes_Health_Backups` (`1dlFpkKYXOCKaausFfVVnBK-qk3hFHA8T`), enthält Health-DB/Schema/Skripte, Hermes-Quick-Backup, Skills/Skripte und schliesst PDFs/Bilder/Rohdokumente aus.

## Support Files

- `references/drive-workflow.md` — Google Drive Befehle, Folder-IDs, Upload/Download-Workflow
- `references/gog-email-attachments.md` — GOG Gmail Attachment-Download, Umbenennung langer Dateinamen, Dokumenten-Verarbeitung
- `references/friday-db-schema-compat.md` — FRIDAY-Schema-Kompatibilität, Debugging-Checkliste, Wert-Konvertierung
- `references/health-manager-pitfalls.md` — Häufige Bugs: Variable Shadowing, CHECK-Constraints, Watchdog-Management, FRIDAY-Kompatibilität
- `references/document-classification.md` — Arztbericht vs. Laborbericht Klassifizierung, Quick-Decision-Tree
- `references/labor-report-generation.md` — Laborbericht-Erstellung aus XLSX, Pivot-Tabellen, Kategorien-Struktur, `ermittlung_datum`-Pitfall

## Google Drive Integration

### Drive-Ordner-Struktur

- **Gesundheitsdaten Inbox** (Upload-Ort): `1HOJXzIjJaUUoLGZgJjAR5V6ZCsOBsGgE`
- **Archiv** (Verarbeitete Dokumente): `1H2zXafzbaRobY8XDcPyRpZBE6mXeTcJe`

### Drive-Workflow: Neue Dokumente aus Google Drive Inbox verarbeiten

1. **Inbox prüfen:** `gog -a friday.uplink@gmail.com drive ls --parent <inbox_id> --json`
2. **Neue Dateien identifizieren** (nicht im lokalen Archiv vorhanden)
3. **Download:** `gog -a friday.uplink@gmail.com drive download <file_id>`
4. **Lokale Kopie** nach `~/.hermes/assets/Gesundheit/inbox/` verschieben
5. **Dokument klassifizieren** (Arztbericht vs. Laborbericht)
6. **Text extrahieren** (PyMuPDF für PDFs, Camelot für Labor-Tabellen)
7. **Datenbank aktualisieren** (laborwerte, health_events, dokumente)
8. **Datei ins lokale Archiv** verschieben
9. **Datei ins Google Drive Archiv** hochladen: `gog -a friday.uplink@gmail.com drive upload <local_path> --parent <archiv_id>`
10. **Datei aus Inbox löschen** (optional: `gog drive delete <file_id>`)
11. **Benachrichtigung** an den User über die Erkenntnisse

### Pitfalls

- **`gog gmail attachment <msgId> <attachId> --output <path>`** — korrekter Befehl zum Herunterladen von E-Mail-Anhängen. Die Attachment-ID ist NICHT die Drive-Datei-ID.
- **`--parent <folder_id>`** statt `--folder` Flag verwenden (Flag `--folder` existiert NICHT)
- **`gog drive move`** verwendet `--parent <folder_id>`, NICHT `--to` oder `--id`
- **`--json`** Flag für parsebare JSON-Ausgabe
- Drive-Download speichert in `~/.config/gogcli/` mit GENERIERTEM Dateinamen — Datei muss manuell umbenannt und verschoben werden
- **`gog drive download`** ohne Parameter zeigt nur Root-Ordner — immer `--parent` mit Folder-ID verwenden
- OCR bei reinen Bild-PDFs (scanned): Tesseract PSM=6 für tabellarische Daten, aber viele Werte können im PDF selbst obscured sein — prüfen ob Werte lesbar bevor man OCR durchführt
- Python-Pakete (fitz, pytesseract) liegen in `~/.local/lib/python3.12/site-packages`, NICHT im hermes-agent venv
- FRIDAY wird NICHT mehr für Gesundheitsdaten verwendet — alles JARVIS
- `backup_original/` enthält alle Originaldateien
- Werte `'<5.0'` etc. müssen vor numerischen Operationen geparsed werden (`lstrip('<>=')`)
- Datenbank-INSERTs prüfen CHECK-Constraints: `status` muss `'neu'`, `'eingearbeitet'` oder `'archiviert'` sein; `daten_typ` muss `'pdf'` oder `'image'` sein
- Watchdog-Daemon unzuverlässig → manuelle Verarbeitung mit `health_manager.process_inbox_pdf()` bevorzugen
- **`.xlsx` Dateien:** Mit `openpyxl` lesen, als Volltext in Datenbank speichern (keine Laborwerte!)
- **Laborbericht-Erstellung:** Skript `scripts/generate_labor_report.py` soll pivot-Tabellen aus XLSX-Referenzdaten/DB erstellen. Format: Spalten pro Blutabnahme, Zeilen pro Parameter, sortiert nach Kategorien. XLSX als primäre Datenquelle verwenden — `ermittlung_datum` in der DB ist OCR-/Importdatum, nicht tatsächliches Abnahmedatum. Aktueller Prüfstand 2026-05-12: `reports/aktuelle_blutwerte.xlsx` existiert und hat Datums-Spalten; das Skript selbst ist aber nicht zuverlässig, weil es aus `ermittlung_datum` liest, den Zeitanteil abschneidet und dadurch DB-Zeilen verfehlen kann; außerdem ist `cat_border` undefiniert. Vor produktiver Nutzung Script fixen und gegen Referenz-XLSX validieren.
- Immer Dokumentendatum innerhalb des Dokuments extrahieren und im Text annotieren: `[DOKUMENTDATUM: YYYY-MM-DD]`
- **STT für Sprachnachrichten:** faster-whisper mit `medium` Modell, Sprache `de`. Installation via `uv pip install`. Gateway restart nach Config-Änderungen. Schweizerdeutsch wird NICHT unterstützt.
- **Tagebuch-Workflow:** User sendet Einträge per Telegram (#ernaehrung, #symptom, etc.). Unstrukturierte Eingabe — Agent extrahiert automatisch Datum, Kategorie, Inhalt.