Risorse · Blog

Tecnologie e protezioni

Tecnologie e protezioni: siti dinamici, sistemi anti-bot, proxy e come aggirare i blocchi.

Tecnologie e protezioni
Protezione anti-scraping: come funzionano i moderni sistemi anti-bot

Come sono fatti i moderni sistemi anti-bot: fingerprinting, analisi comportamentale, captcha e che cosa significa tutto questo per chi gestisce un sito.

7 maggio · 14 min
Tecnologie e protezioni
Espressioni regolari per il parsing: sintassi, pattern e limiti

Espressioni regolari nel parsing dei dati: sintassi di base, pattern utili, limiti di applicazione e perché per l’HTML serve un parser e non le regex.

27 aprile · 8 min
Tecnologie e protezioni
Proxy per il web scraping: guida completa a tipi, privacy e rilevamento

Guida ai proxy per il web scraping: datacenter, residenziali e mobili, rotazione, verifica della privacy e protezione dal rilevamento.

25 aprile · 14 min
Tecnologie e protezioni
Scraping di siti con autenticazione: guida completa con esempi di codice

Scraping di siti con autenticazione: cookie e sessioni, token, CSRF ed esempi di login da codice in Python, Node.js, PHP e Go.

19 aprile · 10 min
Tecnologie e protezioni
Scraping di siti con Selenium: guida dettagliata

Selenium per lo scraping di siti dinamici: configurazione dei driver, attese, elusione del rilevamento dell’automazione e quando conviene un’API.

7 aprile · 10 min
Tecnologie e protezioni
Scraping di siti dinamici: due approcci

Due modi per fare scraping di siti dinamici: reverse engineering delle richieste XHR all’API e browser headless — vantaggi, svantaggi e criteri di scelta.

2 marzo · 16 min
Tecnologie e protezioni
Arricchimento dei dati: che cos’è, quali attributi si aggiungono e da quali fonti

Che cos’è l’arricchimento dei dati: quali attributi si aggiungono ad aziende, prodotti e contatti, da dove si ricavano e come funziona a livello tecnico.

10 febbraio · 9 min
Tecnologie e protezioni
Normalizzazione dei dati: tre significati diversi di uno stesso termine

Il termine «normalizzazione dei dati» ha tre significati: database relazionali, machine learning e pulizia dei dati estratti con lo scraping. Li analizziamo uno per uno.

8 febbraio · 8 min
Tecnologie e protezioni
Parser del DOM: analisi dettagliata

Che cos’è un parser del DOM e come funziona: costruzione dell’albero del documento, navigazione tra i nodi e differenze rispetto agli approcci in streaming e con le regex.

4 febbraio · 6 min