L’obiettivo
I dati del gruppo erano sparsi su diverse decine di fonti: siti web, esportazioni, formati e strutture differenti. Serviva un unico feed XML di formato omogeneo, aggiornato con regolarità, da passare ai sistemi collegati senza doverlo ricomporre a mano.
Cosa abbiamo fatto e quali dati abbiamo raccolto
Abbiamo raccolto i dati da tutte le fonti — siti, file ed esportazioni nei formati più vari — e li abbiamo ricondotti a uno schema unico. Sopra abbiamo montato la composizione del feed XML finale, con validazione e aggiornamento regolare, e organizzato la consegna come DaaS / dati via API.
Le difficoltà e come le abbiamo risolte
La principale: l’eterogeneità. Diverse decine di fonti significano decine di strutture: qui JSON, là tabelle e CSV, altrove documenti, e in certi casi solo pagine web. Abbiamo descritto uno schema di destinazione unico e mappato su di esso ogni fonte.
La seconda: l’attualità. Le fonti si aggiornano a ritmi diversi, quindi la raccolta segue una pianificazione e le modifiche vengono recepite in automatico.
La terza: la correttezza del feed. L’XML finale viene validato nella struttura prima della pubblicazione e ripulito dai duplicati, perché chi consuma il feed non riceva record rotti o doppi.
Il risultato
Il gruppo ha ottenuto un unico feed XML, composto da decine di fonti in automatico e secondo pianificazione, al posto della riconciliazione manuale di esportazioni sparse.
Servizi coinvolti nel caso: DaaS e dati via API · Estrazione di dati web · Monitoraggio delle modifiche a siti e dati
Materiali utili: Parsing di XML · Parsing di JSON · Parsing di documenti · Normalizzazione dei dati