Ethno-API · Data Rescue, Enrichment und QA
Heterogene Quelldaten in ein dokumentiertes Datenprodukt überführt.
Ethno-API verbindet Normalisierung, externe Enrichment-Layer, Identifier-Auflösung und QA-Gates in einem reproduzierbaren JSON-/Parquet-Workflow.
Ausgangslage
Die USDA-Quelldaten lagen nicht als einheitliches, unmittelbar für Analyse und Retrieval nutzbares Datenprodukt vor. Benennungen, Strukturen und externe Identifikatoren mussten zusammengeführt und ihre Grenzen sichtbar gehalten werden.
Mein Beitrag
- Datenprodukt und Pipeline-Architektur konzipiert;
- Quellen und Transformationen strukturiert;
- Enrichment über PubMed, ClinicalTrials.gov, ChEMBL, PatentsView und PubChem orchestriert;
- Identifier- und Reverse-SMILES-QA als begrenzte Konsistenzprüfungen integriert;
- öffentliche Samples, Schema, Methodik und Distribution aufgebaut;
- GitHub-, Hugging-Face- und DOI-Oberflächen dokumentiert.
Was dieser Case belegt
Ich kann eine neue technische Domäne projektgetrieben erschließen, heterogene Datenbestände in ein nachvollziehbares Schema überführen und Qualitätsgrenzen so dokumentieren, dass andere die Daten prüfen und weiterverwenden können.
Grenze: Der Case belegt Datenstrukturierung, Enrichment, Identifier-QA und Produktisierung. Er belegt keine biologische Wahrheit, medizinische Wirkung, Sicherheit, Dosierungsrelevanz, klinische Eignung oder pharmazeutische Validierung.