07 / Progetti
PDF Intelligence Pipeline
Dal PDF alla conoscenza strutturata: estrarre, interpretare, validare, normalizzare, memorizzare.
Il progetto è mostrato a livello di problema, architettura e competenze; alcuni dettagli di implementazione restano riservati.
01 · Il problema
La conoscenza tecnica è chiusa nei PDF. I modelli possono leggere file; non sostituiscono un percorso affidabile di estrazione e validazione.
02 · L’idea
Prima una pipeline deterministica, poi uno strato AI. Un dato non valido non diventa mai una quotazione o una decisione.
03 · Il sistema
PDF → estrazione → parsing → validazione → normalizzazione → SQL → conoscenza.
04 · L’implementazione
Collegato all’AI Yacht Pricing System e al Technical Knowledge Engine. SQL come contratto tra documenti e intelligenza.
05 · Il passo successivo
Irrigidire la validazione su documenti reali disordinati e allargare i tipi di documento di cui la pipeline si può fidare.
L’architettura
- 01 PDF
- 02 Estrazione
- 03 Parsing
- 04 Validazione
- 05 Normalizzazione
- 06 SQL
- 07 Conoscenza
Tecnologie
- Python
- PostgreSQL
- SQLite
- SQLAlchemy
- FastAPI
Categorie
Dati · AI · Engineering