Datos abiertos

Conjuntos de datos abiertos

Cuatro conjuntos de datos sobre cómo se mueve la gente por Europa, publicados como archivos y no como gráficos. Cada fila dice si es medida, presentada, observada o derivada.

Lee primero la columna de evidencia

Cada fila de cada uno de estos archivos lleva un valor de evidencia, y decide para qué sirve esa fila. Los cuatro conjuntos no están al mismo nivel.

Medido
Una salida, una duración o un precio tal como la empresa lo publicó el día en que se leyó. No se calculó nada.
Presentado
Lo que una empresa dice que el servicio hará. Una salida presentada es un plan, no una observación.
Observado
Una conexión que alguna fuente vio circular, registrada en un flujo de datos o en un registro público. Más débil que medido, porque el registro es de segunda mano, y más fuerte que derivado, porque algo circuló.
Derivado
Calculado por nosotros a partir de otros valores: una distancia entre dos pares de coordenadas, un transportista que se supone que sirve un corredor porque su área de servicio publicada cubre ambos extremos, unos gramos obtenidos de un factor publicado.

Un valor derivado sigue siendo derivado en el archivo, en la página que lo muestra y en los datos estructurados.

Los cuatro conjuntos de datos

Ordenados por la solidez de lo que llevan y no por su tamaño.

  1. Qué barcos navegan entre qué puertos, cuándo, operados por quién y qué cobró la naviera.

    Cada una de las 2,709 travesías está medida: la salida, la llegada, el buque y la tarifa tal como los publicaron 120 navieras, leídos en cuatro fechas sondeadas y anotados sin retocar. Se supone que las tarifas están en euros.

    • 2,709travesías
    • 2,190enlaces
    • 120navieras
    • 65países

    Versión 1.0.0, regenerado el 12 de septiembre de 2026, 6,698 filasFormatos: CSV, JSON

    Abrir el conjunto de datos
  2. Qué dice el horario de un viaje de ciudad a ciudad, tramo a tramo, con paradas intermedias y andenes.

    Los 3,025 tramos están todos presentados: planes publicados, no observaciones de servicios que circularon. De 1,254 corredores, 545 devolvieron algo.

    • 545corredores
    • 1,035itinerarios
    • 3,025tramos
    • 184navieras

    Versión 1.0.0, regenerado el 16 de septiembre de 2026, 19,195 filasFormatos: ZIP, GTFS, CSV

    Abrir el conjunto de datos
  3. Qué transportista sirve qué par de lugares, en todos los modos, en todo el mundo.

    164,657 de 293,523 conexiones provienen del área de servicio publicada por un operador que cubre ambos extremos, lo que acredita que el transportista sirve el corredor. Las 128,866 restantes se leen de un feed o de un registro.

    • 293,523tramos
    • 2,093navieras
    • 11,241lugares
    • 211países

    Versión 1.0.0, regenerado el 14 de septiembre de 2026, 307,072 filasFormatos: CSV, PARQUET, JSON

    Abrir el conjunto de datos
  4. Cuántos gramos de CO2e lleva un pasajero-kilómetro, por modo, y de dónde salió cada factor.

    Cada cifra es un factor publicado multiplicado por una distancia modelada. 8 de las 8 filas de la tabla de factores se reproducen desde una fuente que podemos nombrar, y la tabla indica ese estado en la propia fila.

    • 6factores en uso
    • 8,994corredores con más de un modo
    • 18,537filas de corredor y modo
    • 114,524corredores en la red

    Versión 2.0.0, regenerado el 18 de septiembre de 2026, 18,545 filasFormatos: CSV, JSON

    Abrir el conjunto de datos

Válido para los cuatro

Lo que no cambia de un conjunto de datos al siguiente.

Atribución, y esa es toda la licencia
Todos los archivos están bajo CC BY 4.0. Úsalos comercialmente, redibújalos, construye encima, vende lo que construyas. Nombra a Orlero y enlaza de vuelta.
Un Frictionless Data Package, no un CSV suelto
Cada paquete lleva un datapackage.json con un Table Schema por archivo, de modo que quien lo lee conoce el tipo y la unidad de cada columna antes de abrirlo. Las fechas son ISO 8601 con desfase horario, los países ISO 3166-1 alpha-2, el dinero va en unidades menores enteras con su código ISO 4217 y las coordenadas son WGS84.
Cuatro columnas de procedencia en cada fila
source, source_url, fetched_at y evidence, en todas las tablas de los cuatro paquetes. Una fila sacada de contexto sigue diciendo de dónde viene, cuándo se leyó y qué fuerza tiene su afirmación.
Sumas de comprobación y un registro de cambios
Cada paquete incluye un checksums.txt con un SHA-256 por archivo, un README, un CHANGELOG y una versión semántica. Una regeneración que cambia el significado de una columna sube la versión mayor.
Un dato que falta es una celda vacía
Una celda en blanco significa que no tenemos el valor, y un cero significa cero. Nunca un cero en lugar de un blanco, y nunca las letras N barra A.

https://creativecommons.org/licenses/by/4.0/

Cómo citar

Cada página de conjunto de datos lleva su propia cita con formato y una entrada BibTeX para copiar. Todas siguen una misma forma, que para el paquete de ferris queda así:

Orlero (2026). Scheduled ferry crossings with operator-published fares (Version 1.0.0) [Data set]. https://orlero.com/data/ferry-crossings

Todavía sin DOI. Cita la dirección de arriba.

Lo que no está aquí

Los huecos que conviene conocer antes de construir sobre esto.

  • Cada paquete es una instantánea fechada y no un flujo en vivo, y la fecha aparece en la página del conjunto, en el archivo y en los datos estructurados.
  • La cobertura es desigual por diseño: la instantánea de ferris es densa alrededor del Mediterráneo, los horarios son europeos y el grafo de operadores es el que más lejos llega y el que menos se comprueba.
  • Las tarifas son lo que una empresa publicó un día concreto en un punto concreto de la ventana de reserva. No son una curva de precios ni un promedio.
  • Los cuatro paquetes los construyen cuatro scripts distintos a partir de fuentes que se solapan, así que un mismo lugar puede aparecer en dos de ellos con dos identificadores.
Planifica con Ori

Ori, el planificador de viajes

Pregúntale algo así