Servizio · Raccolta di contenuti

Estrazione di articoli di stampa

Configuriamo scraper di notizie su misura per il tuo progetto. Raccogliamo le pubblicazioni dai siti delle testate, da Google News, Bing News e dai feed RSS. Consegniamo titoli, testi completi degli articoli, date, autori e sezioni. Un flusso di contenuti pulito per analisi, modelli di ML e rassegne stampa: via file, feed o API.

100.000+ editori da Google News campione di dati gratuito avvio in 1–3 giorni
Estrazione di articoli di stampa
per chi

A chi serve l’estrazione di notizie

Il flusso di notizie alimenta analisi, modelli e prodotti. L’importante è riceverlo pulito, completo e puntuale.

Analisti e ricercatori

Un flusso di notizie di settore per report, tendenze e monitoraggio dei concorrenti.

Team ML e dati

Corpus di testi pronti per attività di NLP: classificazione, sintesi automatica, NER.

Prodotti e aggregatori

Feed di notizie e rassegne dentro le tue app, senza infrastruttura di raccolta da gestire.

Finanza e investimenti

Notizie su aziende e mercati per segnali di trading e monitoraggio dei rischi.

Legale e compliance

Notizie regolatorie e modifiche normative del tuo settore.

Media e team di contenuti

Monitoraggio dell’agenda mediatica e degli spunti di attualità per le tue pubblicazioni.

modalità di lavoro

Modalità di estrazione delle notizie

Tre modalità in base alle esigenze: estrazione una tantum, fornitura periodica di dati o soluzione personalizzata. Il prezzo lo calcoliamo sulle tue fonti, sui volumi e sulla frequenza di aggiornamento. Ti inviamo il preventivo prima di partire.

Estrazione una tantum
Base

Raccogliere le notizie una sola volta: un archivio di articoli di un periodo per una ricerca o una migrazione.

  • Una o più fonti di dati
  • Campi secondo la tua struttura
  • Esportazione in CSV, Excel, JSON, XML
  • Pulizia e validazione dei dati
Soluzione personalizzata
Su misura

Dati come servizio chiavi in mano: accesso via API, DaaS o un’interfaccia pronta, decine di fonti e SLA.

  • Accesso via API, DaaS o interfaccia
  • Decine e, se serve, centinaia di fonti
  • SLA: tempi di consegna e metriche di qualità dei dati
  • Integrazione con i tuoi sistemi
prezzi trasparenti

Come si calcola il prezzo

Quanto costa l’estrazione di notizie? Il prezzo si compone di fattori chiari, dal numero di fonti al formato di consegna. Preventivo e campione del flusso arrivano prima dell’avvio dei lavori.

Numero di fonti
Quanti siti web e sezioni di Google News e Bing News bisogna coprire.
Volume di dati
Numero di articoli, pagine e campi nell’esportazione.
Frequenza di aggiornamento
Una tantum, una volta al giorno o ogni pochi minuti: più è frequente, maggiore è il carico.
Complessità delle fonti
Pagine web dinamiche, autenticazione e protezioni dei siti.
Formato di consegna
File, feed aggiornabile, API o un’interfaccia web pronta all’uso.
Elaborazione extra
Deduplicazione, sentiment, lingua e filtri per temi e parole chiave.

Preventivo su misura

Descrivi le fonti, i temi e i campi che ti servono: entro un giorno lavorativo ti risponderemo con una stima di costi e tempi e un esempio del flusso.

progetti da 150 €

Che cos’è l’estrazione di notizie

L’estrazione di notizie (news scraping) è la raccolta automatica di pubblicazioni da siti di testate e aggregatori. Un programma percorre le fonti, estrae gli articoli e li porta a una struttura unica. Invece di scorrere a mano decine di homepage, ricevi un unico flusso di dati pulito.

Le notizie restano la principale fonte di informazioni sul mercato. Lo scraper le trasforma da pagine sparse in una tabella o un JSON su cui possono lavorare subito l’analista e il modello.

Cosa restituisce lo scraper per ogni articolo:

  • titolo e testo completo, senza pubblicità né elementi superflui;
  • testata, autore, data e ora di pubblicazione;
  • sezione, tag e parole chiave;
  • link alla fonte originale e alle immagini;
  • lingua e sentiment su richiesta.

Da dove arrivano le fonti: Google News e Bing News

Facciamo scraping dei dati di Google News ed è da lì che prendiamo l’elenco degli editori: oltre 100.000 testate online attive, dalle grandi testate come ANSA, Corriere della Sera e Il Sole 24 Ore ai portali di settore di nicchia.

In più raccogliamo Bing News. L’aggregatore di Microsoft copre meglio la stampa internazionale e serve da verifica incrociata della completezza del flusso.

Cosa significa in pratica:

  • nel flusso entrano testate attive, non siti abbandonati;
  • le nuove fonti sul tuo tema si aggiungono senza ricerche manuali;
  • i motori di ricerca hanno già selezionato e classificato gli editori;
  • una copertura che va dalle agenzie internazionali alla stampa locale.

Ti serve una fonte fuori dagli aggregatori? La aggiungiamo a mano: sale stampa aziendali, blog di settore, portali istituzionali. L’elenco delle testate con i contatti delle redazioni lo prepara il database dei media: è un servizio complementare.

Come funziona l’estrazione di notizie dai siti web

Ogni fonte è costruita a modo suo. Alcune hanno un feed RSS, altre solo normali pagine web, in altre ancora il contenuto viene caricato dagli script. Nell’estrazione di notizie la velocità conta quanto la completezza, per questo ogni tipo di fonte ha il suo raccoglitore dedicato.

Il processo funziona così:

  • scansione programmata della fonte: per le testate chiave, ogni pochi minuti;
  • download e parsing del codice HTML di ogni pagina;
  • estrazione di testo, data, autore e sezione;
  • pulizia da pubblicità, navigazione e codice di servizio;
  • normalizzazione di date e codifiche, unione dei duplicati.

Conserviamo anche i meta tag e le intestazioni della pagina dell’articolo: description, Open Graph, link canonici. Le ripubblicazioni vengono unificate e ogni articolo è contrassegnato con il link alla fonte originale. In uscita non ci sono duplicati.

Testi e metadati passano la validazione. Se il layout del sito cambia, lo scraper se ne accorge e il nostro team di sviluppo aggiorna le regole di parsing. Per i clienti il flusso non si interrompe.

Elaborazione di pagine web di qualsiasi complessità

Non tutti i siti consegnano i contenuti facilmente. Le difficoltà più comuni lo scraper le risolve da solo:

  • pagine web dinamiche: il contenuto viene renderizzato dagli script e la pagina è elaborata da un motore browser;
  • paginazione, scroll infinito e archivi per data;
  • sezioni dietro autenticazione, dove le regole della piattaforma lo consentono;
  • lingue, codifiche e formati di data misti.

Un problema frequente: la testata cambia layout senza preavviso. Il raccoglitore rileva l’anomalia dal calo di completezza, poi un ingegnere sistema le regole. Per te il processo è invisibile. Lavoriamo con un ritmo di scansione rispettoso, senza inviare richieste inutili ai siti.

Notizie da Telegram e dai social network

Molte testate hanno un canale Telegram, e spesso la notizia esce lì prima che sul sito. Su richiesta colleghiamo i canali Telegram pubblici delle testate come fonte aggiuntiva. Il post del canale viene collegato alla testata e unito alla versione dell’articolo sul sito.

Un limite del servizio: non raccogliamo post degli utenti, commenti né menzioni del brand sui social network. Queste attività le copre il monitoraggio del brand.

A cosa serve alle aziende l’estrazione di notizie

Per il business il flusso di notizie non è un fine in sé, ma uno strumento: fa risparmiare tempo e fornisce informazioni su cui basare le decisioni.

Gli usi più comuni:

  • analisi dell’agenda mediatica e delle tendenze di mercato;
  • monitoraggio dei concorrenti: prodotti, operazioni, cambi ai vertici;
  • notizie sulle aziende per segnali di trading e scoring;
  • corpus di articoli per l’addestramento di modelli ML;
  • feed di notizie pronti dentro i tuoi prodotti.

Per i team legali e di compliance il flusso copre la parte regolatoria. Entra in vigore una nuova legge o si aggiornano i requisiti, per esempio in materia di protezione dei dati personali con il GDPR, e la rassegna tematica arriva subito al team. Non tocchiamo profili né commenti degli utenti: raccogliamo solo contenuto editoriale.

Ogni progetto inizia con un campione del flusso. Esamini i dati, verifichi struttura e volumi, poi parte il lavoro. Se il progetto esce dagli standard, montiamo un prototipo. A ogni progetto assegniamo un project manager dedicato.

Cos’altro facciamo

L’estrazione di notizie copre l’acquisizione delle pubblicazioni. Le attività correlate le risolviamo con servizi dedicati:

Dal 2015 raccogliamo dati per analisi e ML. Prima di partire ti inviamo gratis un campione del flusso sul tuo tema. Risposta entro un giorno lavorativo.

case study

Dove l’estrazione di notizie ha già fatto la differenza

Case study in breve sull’estrazione di notizie: quali flussi abbiamo raccolto e quali risultati hanno portato ai clienti.

perché noi

Perché i clienti ci affidano l’estrazione di notizie

Dal 2015 raccogliamo dati per analisi e ML. Un flusso di notizie ha valore solo se è completo, pulito e arriva puntuale.

01
Testi puliti

Eliminiamo pubblicità, navigazione e codice di servizio. Restano il titolo, il testo dell’articolo e i metadati.

02
Qualsiasi fonte

RSS, HTML, siti dinamici e archivi. Raccogliamo anche dove i feed non ci sono.

03
Unione dei duplicati

Le ripubblicazioni vengono raggruppate con il riferimento alla fonte originale. Ogni articolo lo vedi una volta sola.

04
Velocità

Le fonti chiave vengono interrogate ogni pochi minuti. Il flusso arriva quasi in tempo reale.

05
Manutenzione degli scraper

La testata ha cambiato layout? Lo sistemiamo noi. Della completezza del flusso risponde il nostro team di sviluppo.

06
Trasparenza

Preventivo e campione del flusso prima di partire, contratto e un prezzo chiaro senza costi nascosti.

come lavoriamo

Come mettiamo in funzione lo scraper di notizie: le fasi del lavoro

Un processo trasparente: prepariamo il preventivo e inviamo un esempio del flusso prima dell’avvio dei lavori. Niente tariffe nascoste né sorprese.

fase 1

Richiesta

Ci invii l’elenco delle fonti o i temi. Basta una breve descrizione del progetto.

fase 2

Test e preventivo

Analisi della nicchia sui dati di Google News e Bing News, stima di volumi e tempi, campione gratuito del flusso.

fase 3

Sviluppo e avvio

Configuriamo scraper, pulizia, deduplicazione e formato del flusso.

fase 4

Flusso di dati

Le pubblicazioni arrivano via feed, file o API. Teniamo sotto controllo completezza e qualità.

risultato

Cosa ricevi

Il risultato è un flusso strutturato di pubblicazioni senza rumore né duplicati, pronto da caricare nel tuo sistema.

Flusso strutturato

Pubblicazioni con testi completi e metadati: JSON, XML, CSV secondo il tuo schema.

Feed aggiornabile

Le nuove pubblicazioni arrivano in modo programmato, fino al tempo reale.

Accesso via API

Il flusso entra direttamente nei tuoi modelli, dashboard e prodotti.

Interfaccia web

Un pannello con il feed di notizie, filtri per temi e fonti ed esportazione.

Pulizia e arricchimento

Testi puliti, deduplicazione, lingua, sentiment e classificazione per temi.

Supporto e garanzia

Teniamo d’occhio la completezza del flusso, ripariamo gli scraper e aggiungiamo fonti su richiesta.

servizi correlati

Cos’altro possiamo offrirti

L’estrazione di notizie copre solo una parte del lavoro sui dati. Le aree correlate le impostiamo e configuriamo in base al tuo progetto.

domande e risposte

Domande sull’estrazione di notizie

Se non trovi la risposta che cerchi, invia una richiesta: ti risponderemo entro un giorno lavorativo.

Quali fonti potete raccogliere?

Testate online, aggregatori di notizie, portali di settore e sale stampa aziendali. Di fatto non ci sono limitazioni sui siti. Lavoriamo anche con fonti senza RSS: siti dinamici, archivi e sezioni dietro autenticazione, dove le regole della piattaforma lo consentono. I canali Telegram pubblici delle testate li colleghiamo su richiesta.

Quanto costa l’estrazione di notizie?

I progetti partono da 150 €. Il prezzo finale dipende dal numero di fonti, dal volume di dati, dalla frequenza di aggiornamento e dall’elaborazione extra (l’analisi dei fattori è qui sopra). Preventivo esatto e campione di dati te li inviamo gratis prima dell’avvio dei lavori.

È possibile avere un archivio degli anni passati?

Sì. Ricostruiamo lo storico dagli archivi delle testate e dagli archivi web, fin dove arriva la profondità di conservazione della fonte. Un archivio di articoli dei periodi passati è utile per addestrare i modelli e per le analisi retrospettive.

Con quale ritardo arrivano le notizie?

Dipende dalla modalità. Con la consegna in flusso continuo le fonti chiave vengono interrogate ogni pochi minuti e la pubblicazione entra nel flusso quasi subito dopo l’uscita. La velocità dello scraper sul tuo elenco di fonti la verifichiamo durante il test.

Da dove prendete l’elenco delle testate?

Facciamo scraping dei dati di Google News ed è da lì che prendiamo l’elenco degli editori: oltre 100.000 testate online di ogni tematica. In più raccogliamo Bing News, l’aggregatore di notizie di Microsoft: amplia la copertura delle fonti internazionali e aiuta a verificare la completezza del flusso. I siti fuori dagli aggregatori li aggiungiamo a mano in base alla tua lista.

In che formato consegnate i dati?

JSON, XML, CSV: via file, feed aggiornabile o API. Lo schema dei campi lo concordiamo in base al tuo sistema. Possiamo consegnare i dati anche in un’interfaccia web con feed, filtri ed esportazione.

Dobbiamo installare qualcosa?

No. Non serve installare alcun programma. Tutto gira dalla nostra parte: scraper, pulizia, archiviazione e consegna. Sviluppo e manutenzione sono a carico nostro. Tu ricevi i dati pronti in un formato comodo.

Cosa succede se un sito inizia a bloccare gli scraper?

Cambi di layout e protezioni delle piattaforme rientrano nelle normali difficoltà dello scraping. Il raccoglitore rileva l’anomalia dal calo di completezza e il nostro team aggiorna le regole di parsing. Per i clienti il processo è invisibile: il flusso continua ad arrivare.

Si possono filtrare le notizie per temi e parole chiave?

Sì. Definisci sezioni, parole chiave o una lista di aziende, e nel flusso entra solo il contenuto rilevante. Su richiesta aggiungiamo classificazione per temi, sentiment ed estrazione di entità: aziende, persone, ticker.

Analizzate le menzioni del brand nelle notizie?

Sono servizi complementari. Le pubblicazioni sulla tua azienda, con sentiment e reach, le segue il monitoraggio di media e stampa. I post sui social network li intercetta il monitoraggio del brand. L’estrazione di notizie consegna l’intero flusso sul tema, senza legarlo a un brand.

contatti

Ti serve l’estrazione di notizie? Ti inviamo un campione del flusso

Descrivi le fonti, i temi e i campi che ti servono: al resto pensiamo noi. Un project manager ti risponderà con il preventivo e un esempio di dati entro un giorno lavorativo.

Ti risponderemo entro un giorno lavorativo.