Dentro i dati: 9.516 sondaggi, due licenze e un tasso di anomalie da spiegare
Negli ultimi giorni abbiamo completato l'acquisizione di un nuovo harvest dal registro ufficiale dei sondaggi politico-elettorali (banca dati art. 8 c.3 L. 28/2000, Presidenza del Consiglio): 7.958 sondaggi, raccolti pagina per pagina dal registro pubblico. Si affiancano ai 1.558 già in archivio, di provenienza onData con licenza aperta. Questo articolo racconta cosa c'è dentro, e soprattutto cosa non c'è.
- 9.516sondaggi totali in archivio, da giugno 2012 a agosto 2026
- 19,4%segnalati
suspectsulla fonte ufficiale (8,8% su onData) - 90,7%dei sondaggi ufficiali senza codice territoriale assegnabile
- 655giorni di ritardo massimo tra fine rilevazione e deposito
Due fonti, due licenze, mai mescolate
I 7.958 sondaggi del registro ufficiale non hanno una licenza di riuso dichiarata: la raccolta è pubblica per obbligo di legge, ma non è per questo liberamente redistribuibile. I 1.558 sondaggi onData sono invece rilasciati in CC-BY-4.0.
Le due fonti restano sempre distinte nel nostro sistema. Non le presentiamo mai sotto un'unica etichetta di licenza, ogni riga porta con sé la propria fonte, il proprio riferimento e la propria attribuzione, e le esportazioni rispettano il regime della fonte da cui il dato proviene.
Il registro non è un archivio di intenzioni di voto
È la sorpresa più grande dell'harvest: metà del registro non parla di elezioni.
Quasi la metà dei depositi sono indagini tematiche — opinioni su singole politiche, consumi, atteggiamenti — e solo poco più di un quarto sono intenzioni di voto nazionali. È un archivio dell'attività demoscopica del Paese, non un archivio elettorale, e questo cambia il modo in cui va interrogato.
Perché una fonte ha più anomalie dell'altra (e non per il motivo ovvio)
La quota di sondaggi segnalati suspect dai nostri controlli è 19,4% sulla fonte ufficiale contro 8,8% su onData. La spiegazione intuitiva — "il registro contiene molte più domande tematiche, e quelle sono più difficili da normalizzare" — è smentita dai dati.
suspect, per tipo di quesito
I quesiti tematici hanno un tasso di anomalie dell'8,4%, sotto la media della fonte. Le segnalazioni si concentrano invece proprio dove il dato ci interessa di più: intenzioni di voto nazionali (39,4%), comunali (41,6%) e regionali (41,2%).
E confrontando le due fonti a parità di tipo di quesito il divario non si chiude, si allarga: sulle sole intenzioni di voto nazionali, 39,4% sul registro ufficiale contro 7,7% su onData.
La causa vera è il formato. Il registro raccoglie documenti depositati dagli istituti, e i campi strutturati sono pochi: quasi tutto va estratto dal testo e dagli allegati. I flag più frequenti lo dicono chiaramente.
| Flag di qualità | Sondaggi | Cosa significa |
|---|---|---|
margin_error_confidence_unknown | 4.514 | Margine d’errore senza livello di confidenza dichiarato |
attachment_unparsed | 2.127 | Allegato presente ma non estraibile automaticamente |
sample_size_unparsed | 1.679 | Numerosità campionaria non riconosciuta nel testo |
vote_question_unparsed_q1 | 284 | Quesito di voto presente ma non ricostruibile |
geo_unresolved | 142 | Territorio indicato ma non risolvibile a un ente |
onData, che è un dataset già normalizzato a monte da esseri umani, non paga questo prezzo. Detto altrimenti: il tasso di anomalie misura la distanza dal documento originale, non l'affidabilità dell'istituto che ha fatto il sondaggio.
Cosa il registro non contiene affatto
- Nessun codice ISTAT del territorio. Solo il nome in testo libero ("comune di Milano", "Piemonte"). La geolocalizzazione avviene per corrispondenza di nome: quando il nome è ambiguo (comuni omonimi) o non risolvibile, il sondaggio resta senza geografia assegnata ed esplicitamente segnalato — mai forzato al primo risultato plausibile. Oggi resta senza territorio il 90,7% dei sondaggi ufficiali.
- Numerosità campionaria assente in un caso su cinque. 1.679 sondaggi ufficiali (21,1%) non riportano un campione leggibile: senza quello non è calcolabile un margine d'errore, e il sondaggio non può entrare in nessun calcolo pesato.
- Nessuna anagrafica di partito. Le liste compaiono come etichette di testo. È il limite che pesa di più sulle analisi ed è quello su cui stiamo lavorando adesso.
Sull'ultimo punto vale la pena essere concreti, perché è il tipo di trappola che produce grafici sbagliati senza che nessuno se ne accorga. Nell'archivio l'etichetta "Futuro Nazionale" compare sia in tre rilevazioni del 2013, dove vale in media lo 0,6%, sia in 184 rilevazioni del 2026, dove vale il 5,0%: due soggetti politici diversi con lo stesso nome. E l'etichetta "Roberto Vannacci", che in alcune rilevazioni vale oltre il 20%, non è affatto una lista: è un quesito di gradimento personale finito dentro un sondaggio classificato come voto politico.
Finché l'anagrafica canonica non è completa, ogni aggregazione per partito su questa fonte va fatta per corrispondenza esplicita di etichetta e dichiarata come tale — è quello che facciamo negli altri due articoli di oggi.
Quando un sondaggio "appare" non è quando è stato fatto
La data in cui un sondaggio compare nel registro non è la data in cui è stato realizzato.
| Ritardo deposito − fine rilevazione | Registro ufficiale | onData |
|---|---|---|
| Mediana | 3 giorni | 3 giorni |
| 90° percentile | 14 giorni | 5 giorni |
| Massimo | 655 giorni | 369 giorni |
Nel caso tipico il ritardo è irrilevante, ma la coda è lunga e va sempre nella stessa direzione: il dato sembra più recente di quanto sia. Per questo tutte le serie storiche in piattaforma collocano il sondaggio sulla fine della rilevazione quando disponibile, e ripiegano sulla data di deposito solo quando la prima manca.
Perché questo lavoro conta
I sondaggi non sono un dato elettorale osservato: sono stime di terze parti, prodotte con metodi che non controlliamo, su campioni che spesso non conosciamo. Nella nostra architettura restano perciò sempre separati dai risultati elettorali reali, e non entrano mai come "verità" nei modelli previsionali — solo come una delle variabili di contesto, con il proprio flag di qualità al seguito.
Pubblicare l'inventario dei difetti di un archivio insieme all'archivio è la parte meno appariscente di questo lavoro, ed è quella che rende utilizzabile tutto il resto. Manterremo lo stesso standard a ogni prossimo arricchimento.
- L'archivio arriva a 9.516 sondaggi da due fonti con licenze diverse, tenute sempre separate.
- Il registro ufficiale è per metà indagini tematiche: non è un archivio elettorale.
- Il tasso di anomalie più alto non dipende dai quesiti tematici, che sono fra i più puliti: dipende dall'estrazione da documenti depositati.
- Le lacune vere sono territorio, campione e anagrafica di partito — le dichiariamo invece di colmarle a indovinare.
- Un sondaggio va datato alla fine della rilevazione, non al deposito.
Fonte: archivio sondaggi ElectionLab — registro ufficiale dei sondaggi politico-elettorali (banca dati art. 8 c.3 L. 28/2000, Presidenza del Consiglio) e dataset onData (CC-BY-4.0). Conteggi al 29 agosto 2026 sull'intero archivio. Esplora l'archivio nella sezione Sondaggi, o leggi le due analisi che ne derivano: il calo del centrodestra e gli house effect degli istituti.
— ElectionLab Studio