Guide, ricerche e case study su web scraping, monitoraggio dei prezzi e fornitura di dati per analisi, marketing e prodotto.
Come sono fatti i moderni sistemi anti-bot: fingerprinting, analisi comportamentale, captcha e che cosa significa tutto questo per chi gestisce un sito.
Scraping, parsing e crawling: in che cosa si differenziano questi processi, come sono collegati tra loro e perché si confondono così spesso.
Come raccogliere dati dai siti web senza essere programmatori: dal copia-incolla manuale e dalle estensioni fino allo scraping su commissione, chiavi in mano.
Web scraping in Ruby: Nokogiri, HTTParty, Mechanize e Watir, dall’analisi delle pagine statiche all’automazione del browser.
Parsing di feed RSS e Atom: struttura dei formati, librerie pronte all’uso e monitoraggio di notizie e blog senza scansionare le pagine.
Espressioni regolari nel parsing dei dati: sintassi di base, pattern utili, limiti di applicazione e perché per l’HTML serve un parser e non le regex.
Guida ai proxy per il web scraping: datacenter, residenziali e mobili, rotazione, verifica della privacy e protezione dal rilevamento.
Controllo di un browser reale da PHP: Symfony Panther, chrome-php e Selenium per lo scraping di siti dinamici con JavaScript senza uscire dallo stack PHP.
Come lavorare con XML nei vari linguaggi: DOM contro SAX, XPath, namespace e lettura in streaming delle esportazioni di grandi dimensioni senza esaurire la memoria.