Dati aperti

Dataset aperti

Quattro dataset su come ci si sposta in Europa, pubblicati come file e non come grafici. Ogni riga dice se è misurata, depositata, osservata o derivata.

Leggi prima la colonna dell'evidenza

Ogni riga di ciascuno di questi file porta un valore di evidenza, ed è esso a decidere a che cosa la riga può servire. I quattro dataset non stanno sullo stesso livello.

Misurato
Una partenza, una durata o un prezzo così come la compagnia li ha pubblicati nel giorno della lettura. Nulla è stato calcolato.
Depositato
Ciò che una compagnia dichiara che il servizio farà. Una partenza depositata è un piano e non un'osservazione.
Osservato
Un collegamento che una fonte ha visto viaggiare, registrato in un flusso o in un registro pubblico. Più debole di misurato, perché il dato è di seconda mano, e più forte di derivato, perché qualcosa ha davvero viaggiato.
Derivato
Calcolato da noi a partire da altri valori: una distanza fra due coppie di coordinate, un vettore che si presume serva un corridoio perché la sua area di servizio pubblicata copre entrambi i capi, un numero di grammi ricavato da un fattore pubblicato.

Un valore derivato resta derivato nel file, nella pagina che lo mostra e nei dati strutturati.

I quattro dataset

Ordinati per la solidità di ciò che portano e non per dimensione.

  1. Quali navi collegano quali porti, quando, gestite da chi e quanto ha chiesto la compagnia.

    Ognuna delle 2709 traversate è misurata: partenza, arrivo, nave e tariffa così come 120 compagnie li hanno pubblicati, letti in quattro date sondate e trascritti senza modifiche. Si assume che le tariffe siano in euro.

    • 2709traversate
    • 2190collegamenti
    • 120compagnie
    • 65paesi

    Versione 1.0.0, ricostruito il 12 settembre 2026, 6698 righeFormati: CSV, JSON

    Apri il dataset
  2. Che cosa dice l'orario di un viaggio da città a città, tratta per tratta, con fermate intermedie e binari.

    Tutte le 3025 tratte sono depositate: piani pubblicati, non osservazioni di servizi che hanno viaggiato. Su 1254 corridoi, 545 hanno restituito qualcosa.

    • 545corridoi
    • 1035itinerari
    • 3025tratte
    • 184compagnie

    Versione 1.0.0, ricostruito il 16 settembre 2026, 19.195 righeFormati: ZIP, GTFS, CSV

    Apri il dataset
  3. Quale vettore serve quale coppia di luoghi, su ogni mezzo, in tutto il mondo.

    164.657 su 293.523 connessioni provengono dall'area di servizio pubblicata da un operatore che copre entrambi gli estremi, il che attesta che il vettore serve il corridoio. Le restanti 128.866 sono lette da un feed o da un registro.

    • 293.523tratte
    • 2093compagnie
    • 11.241luoghi
    • 211paesi

    Versione 1.0.0, ricostruito il 14 settembre 2026, 307.072 righeFormati: CSV, PARQUET, JSON

    Apri il dataset
  4. Quanti grammi di CO2e porta un passeggero-chilometro, per mezzo, e da dove viene ciascun fattore.

    Ogni cifra è un fattore pubblicato moltiplicato per una distanza modellata. 8 delle 8 righe della tabella dei fattori si riproducono da una fonte che possiamo nominare, e la tabella indica questo stato nella riga stessa.

    • 6fattori in uso
    • 8994corridoi serviti da più di un mezzo
    • 18.537righe di corridoio e mezzo
    • 114.524corridoi nella rete

    Versione 2.0.0, ricostruito il 18 settembre 2026, 18.545 righeFormati: CSV, JSON

    Apri il dataset

Vero per tutti e quattro

Le parti che non cambiano da un dataset all'altro.

Attribuzione, e la licenza è tutta qui
Ogni file è CC BY 4.0. Usalo a fini commerciali, ridisegnalo, costruiscici sopra, vendi ciò che costruisci. Nomina Orlero e metti un collegamento di ritorno.
Un Frictionless Data Package, non un CSV isolato
Ogni pacchetto porta un datapackage.json con un Table Schema per file, così chi legge conosce tipo e unità di ogni colonna prima di aprirla. Le date sono ISO 8601 con fuso, i paesi ISO 3166-1 alpha-2, il denaro è in unità minori intere con il suo codice ISO 4217 e le coordinate sono WGS84.
Quattro colonne di provenienza su ogni riga
source, source_url, fetched_at ed evidence, in ogni tabella di tutti e quattro i pacchetti. Una riga estratta dal suo contesto dice ancora da dove viene, quando è stata letta e quanto è forte ciò che afferma.
Somme di controllo e un registro delle modifiche
Ogni pacchetto porta un checksums.txt con uno SHA-256 per file, un README, un CHANGELOG e una versione semantica. Una ricostruzione che cambia il significato di una colonna alza la versione maggiore.
Un dato mancante è una cella vuota
Una cella vuota vuol dire che il valore non ce l'abbiamo, e uno zero vuol dire zero. Mai uno zero al posto di una cella vuota, e mai le lettere N barra D.

https://creativecommons.org/licenses/by/4.0/

Come citare

Ogni pagina di dataset porta la propria citazione formattata e una voce BibTeX da copiare. Seguono tutte una sola forma, che per il pacchetto dei traghetti suona così:

Orlero (2026). Scheduled ferry crossings with operator-published fares (Version 1.0.0) [Data set]. https://orlero.com/data/ferry-crossings

Ancora nessun DOI. Cita l'indirizzo qui sopra.

Che cosa non c'è

Le lacune che conviene conoscere prima di costruirci sopra.

  • Ogni pacchetto è un'istantanea datata e non un flusso in tempo reale, e la data è stampata sulla pagina del dataset, nel file e nei dati strutturati.
  • La copertura è disomogenea per scelta: l'istantanea dei traghetti è fitta attorno al Mediterraneo, gli orari sono europei e il grafo dei vettori arriva più lontano di tutti ed è il meno verificato.
  • Le tariffe sono ciò che una compagnia ha pubblicato in un giorno, in un punto della finestra di prenotazione. Non sono una curva dei prezzi e non sono una media.
  • I quattro pacchetti sono costruiti da quattro script distinti a partire da fonti che si sovrappongono, quindi uno stesso luogo può comparire in due di essi con due identificatori.
Pianifica con Ori

Ori, il pianificatore di viaggi

Provi a chiedere così