Открытые данные

Открытые наборы данных

Четыре набора данных о том, как люди перемещаются по Европе, выпущенные в виде файлов, а не диаграмм. Каждая строка говорит, измерена она, подана, наблюдалась или выведена.

Сначала прочитайте столбец доказательности

Каждая строка в каждом из этих файлов несёт значение доказательности, и именно оно решает, на что строка годится. Четыре набора стоят не на одном уровне.

Измерено
Отправление, длительность или цена в том виде, в каком перевозчик опубликовал их в день считывания. Ничего не рассчитывалось.
Подано
То, что перевозчик заявляет о будущем рейсе. Поданное отправление это план, а не наблюдение.
Наблюдалось
Соединение, которое какой-то источник видел в движении, зафиксированное в потоке данных или в публичном реестре. Слабее измеренного, потому что запись из вторых рук, и надёжнее выведенного, потому что что-то действительно шло.
Выведено
Рассчитано нами из других значений: расстояние по двум парам координат, перевозчик, о котором предполагается, что он обслуживает коридор, потому что его опубликованная зона обслуживания покрывает оба конца, число граммов из опубликованного коэффициента.

Выведенное значение остаётся выведенным в файле, на странице над ним и в структурированных данных.

Четыре набора данных

Расположены по надёжности того, что они несут, а не по размеру.

  1. Какие суда ходят между какими портами, когда, под чьим управлением и сколько взял перевозчик.

    Каждый из 2 709 рейсов измерен: отправление, прибытие, судно и тариф в том виде, в каком их опубликовали 120 перевозчиков, считанные в четыре запрошенные даты и записанные без изменений. Тарифы предполагаются в евро.

    • 2 709рейсов
    • 2 190переправ
    • 120перевозчиков
    • 65стран

    Версия 1.0.0, пересобрано 12 сентября 2026 г., строк: 6 698Форматы: CSV, JSON

    Открыть набор данных
  2. Как выглядит поездка из города в город по расписанию, участок за участком, с промежуточными остановками и путями.

    Все 3 025 участков поданы: это опубликованные планы, а не наблюдения за тем, что действительно прошло. Из 1 254 коридоров хоть что-то вернули 545.

    • 545коридоров
    • 1 035маршрутов
    • 3 025участков
    • 184перевозчиков

    Версия 1.0.0, пересобрано 16 сентября 2026 г., строк: 19 195Форматы: ZIP, GTFS, CSV

    Открыть набор данных
  3. Какой перевозчик обслуживает какую пару мест, по всем видам транспорта, по всему миру.

    164 657 из 293 523 сообщений взяты из опубликованной зоны обслуживания перевозчика, покрывающей оба конца, что подтверждает: перевозчик обслуживает этот коридор. Остальные 128 866 прочитаны из ленты или из реестра.

    • 293 523участков
    • 2 093перевозчиков
    • 11 241мест
    • 211стран

    Версия 1.0.0, пересобрано 14 сентября 2026 г., строк: 307 072Форматы: CSV, PARQUET, JSON

    Открыть набор данных
  4. Сколько граммов CO2e несёт пассажиро-километр, по видам транспорта, и откуда взялся каждый коэффициент.

    Каждое число получается умножением опубликованного коэффициента на смоделированное расстояние. 8 из 8 строк таблицы коэффициентов воспроизводятся из источника, который мы можем назвать, и таблица указывает этот статус в самой строке.

    • 6используемых коэффициентов
    • 8 994коридоров более чем с одним видом транспорта
    • 18 537строк коридоров и видов транспорта
    • 114 524коридоров в сети

    Версия 2.0.0, пересобрано 18 сентября 2026 г., строк: 18 545Форматы: CSV, JSON

    Открыть набор данных

Верно для всех четырёх

То, что не меняется от одного набора данных к другому.

Указание авторства, и в этом вся лицензия
Каждый файл выпущен под CC BY 4.0. Используйте в коммерческих целях, перерисовывайте, стройте поверх, продавайте то, что построите. Назовите Orlero и поставьте обратную ссылку.
Пакет Frictionless Data, а не отдельный CSV
В каждом пакете есть datapackage.json с Table Schema для каждого файла, так что читатель знает тип и единицу измерения каждого столбца до того, как откроет его. Даты в ISO 8601 со смещением, страны в ISO 3166-1 alpha-2, деньги в целых минорных единицах с кодом ISO 4217, координаты в WGS84.
Четыре столбца происхождения в каждой строке
source, source_url, fetched_at и evidence, в каждой таблице всех четырёх пакетов. Строка, вырванная из контекста, по-прежнему говорит, откуда она, когда её считали и насколько сильно её утверждение.
Контрольные суммы и журнал изменений
В каждом пакете есть checksums.txt с SHA-256 на файл, README, CHANGELOG и семантическая версия. Пересборка, меняющая смысл столбца, поднимает мажорную версию.
Отсутствующие данные это пустая ячейка
Пусто означает, что значения нет, а ноль означает ноль. Никогда ноль вместо пустоты и никогда «нет данных».

https://creativecommons.org/licenses/by/4.0/

Как цитировать

На странице каждого набора есть своя оформленная ссылка и запись BibTeX для копирования. Все они следуют одной форме, которая для паромного пакета выглядит так:

Orlero (2026). Scheduled ferry crossings with operator-published fares (Version 1.0.0) [Data set]. https://orlero.com/data/ferry-crossings

DOI пока нет. Цитируйте адрес выше.

Чего здесь нет

Пробелы, о которых стоит знать, прежде чем что-то на этом строить.

  • Каждый пакет это датированный снимок, а не живой поток, и дата напечатана на странице набора, в файле и в структурированных данных.
  • Охват неравномерен намеренно: паромный снимок плотен вокруг Средиземного моря, расписания европейские, а граф перевозчиков простирается дальше всех и проверен меньше всех.
  • Тарифы это то, что перевозчик опубликовал в один день в одной точке окна бронирования. Это не кривая цен и не среднее.
  • Четыре пакета собираются четырьмя отдельными скриптами из пересекающихся источников, поэтому одно и то же место может встретиться в двух из них под двумя идентификаторами.
Спланировать с Ori

Ori, планировщик поездок

Спросите примерно так