# Docling Reprocessing Workflow — Gesundheitsdokumente

## Problemstellung (2026-05-12)

Von 59 Dokumenten in der Datenbank haben nur 9 extrahierte Volltexte (`extrahierte_inhalte` nicht leer). 50 Dokumente sind nicht durchsuchbar.

## Dokumentenstatus (Mai 2026)

| Status | Anzahl | Durchsuchbar? |
|--------|--------|---------------|
| `neu` | 19 | ❌ Nein |
| `eingearbeitet` | 29 | ⚠️ Nur ~9 mit Volltext |
| `archiviert` | 11 | ✅ Ja |

## Priorisierte Reihenfolge

### Phase 1: 19 `neu`-Dokumente
- **17 LABOR-Berichte** → Docling → Tabellen in `laborwerte`-Tabelle
- **1 BEFUNDE** (Vista Brugg) → Docling OCR
- **1 SONSTIGES** (Rheumatologie) → Docling Volltext

### Phase 2: 29 `eingearbeitet` ohne Volltext
- Vor allem BEFUNDE nachbearbeiten
- Docling für Volltext-Extraktion verwenden

### Phase 3: Deduplizierung
- Duplicate-Einträge bereinigen (z.B. `ksb_rheumatologie_bericht` x2, `email_ksb_rheumatologie_thread` x2)

## Docling Befehl

```bash
# Im hermes-agent venv
cd /home/agent/.hermes/hermes-agent && uv pip install docling

# CLI
docling /pfad/zum/dokument.pdf

# Python API
import sys
sys.path.insert(0, "/home/agent/.hermes/hermes-agent/venv/lib/python3.11/site-packages")
from docling.document_converter import DocumentConverter
converter = DocumentConverter()
result = converter.convert("dokument.pdf")
print(result.document.export_to_markdown())
```

## PaddleOCR Fallback

Nur verwenden wenn Docling versagt (selten):
```bash
tesseract input.png output -l deu+eng --psm 6 --oem 3
```

## Validierung

Nach der Extraktion prüfen:
1. Sind Laborwerte vollständig extrahiert?
2. Sind Diagnosen und Datums enthalten?
3. Ist der Text lesbar und strukturiert?
4. `extrahierte_inhalte`-Feld in DB aktualisieren
