Formati e fonti di dati: HTML, XML, JSON, API e database.
Scraping, parsing e crawling: in che cosa si differenziano questi processi, come sono collegati tra loro e perché si confondono così spesso.
Parsing di feed RSS e Atom: struttura dei formati, librerie pronte all’uso e monitoraggio di notizie e blog senza scansionare le pagine.
Come lavorare con XML nei vari linguaggi: DOM contro SAX, XPath, namespace e lettura in streaming delle esportazioni di grandi dimensioni senza esaurire la memoria.
Parsing di URL: da cosa è composto un indirizzo, come scomporre e costruire i link e come gestire parametri di query e codifica nei vari linguaggi.
Analisi dei file di testo: lettura riga per riga di grandi volumi, codifiche, espressioni regolari ed esempi in vari linguaggi di programmazione.
Perché iniziare la raccolta dalla sitemap.xml: parsing delle sitemap indice, scelta degli URL giusti e risparmio sulla scansione del sito prima dello scraping.
Estrazione di testo e tabelle dai file PDF: livelli di testo contro scansioni, OCR con Tesseract ed esempi di codice in Python, JavaScript e Java.
Parsing di log di server e applicazioni: formati di access ed error log, espressioni regolari, strumenti pronti ed esempi di analisi.
Il parsing di JSON in ogni dettaglio: strutture annidate, streaming di file di grandi dimensioni, JSONPath ed errori tipici nel lavoro con le API.