Tecnologie e protezioni: siti dinamici, sistemi anti-bot, proxy e come aggirare i blocchi.
Come sono fatti i moderni sistemi anti-bot: fingerprinting, analisi comportamentale, captcha e che cosa significa tutto questo per chi gestisce un sito.
Espressioni regolari nel parsing dei dati: sintassi di base, pattern utili, limiti di applicazione e perché per l’HTML serve un parser e non le regex.
Guida ai proxy per il web scraping: datacenter, residenziali e mobili, rotazione, verifica della privacy e protezione dal rilevamento.
Scraping di siti con autenticazione: cookie e sessioni, token, CSRF ed esempi di login da codice in Python, Node.js, PHP e Go.
Selenium per lo scraping di siti dinamici: configurazione dei driver, attese, elusione del rilevamento dell’automazione e quando conviene un’API.
Due modi per fare scraping di siti dinamici: reverse engineering delle richieste XHR all’API e browser headless — vantaggi, svantaggi e criteri di scelta.
Che cos’è l’arricchimento dei dati: quali attributi si aggiungono ad aziende, prodotti e contatti, da dove si ricavano e come funziona a livello tecnico.
Il termine «normalizzazione dei dati» ha tre significati: database relazionali, machine learning e pulizia dei dati estratti con lo scraping. Li analizziamo uno per uno.
Che cos’è un parser del DOM e come funziona: costruzione dell’albero del documento, navigazione tra i nodi e differenze rispetto agli approcci in streaming e con le regex.