Otwarte dane

Otwarte zbiory danych

Cztery zbiory danych o tym, jak ludzie przemieszczają się po Europie, wydane jako pliki, a nie jako wykresy. Każdy wiersz mówi, czy jest zmierzony, złożony, zaobserwowany czy wyprowadzony.

Najpierw przeczytaj kolumnę dowodu

Każdy wiersz w każdym z tych plików niesie wartość dowodu i to ona rozstrzyga, do czego wiersz się nadaje. Cztery zbiory nie stoją na tym samym poziomie.

Zmierzone
Odjazd, czas trwania albo cena w takiej postaci, w jakiej przewoźnik opublikował je w dniu odczytu. Nic nie zostało wyliczone.
Złożone
To, co przewoźnik zapowiada, że kurs zrobi. Złożony odjazd jest planem, a nie obserwacją.
Zaobserwowane
Połączenie, które jakieś źródło widziało w ruchu, zapisane w strumieniu danych albo w publicznym rejestrze. Słabsze niż zmierzone, bo zapis jest z drugiej ręki, i mocniejsze niż wyprowadzone, bo coś jednak pojechało.
Wyprowadzone
Wyliczone przez nas z innych wartości: odległość z dwóch par współrzędnych, przewoźnik, o którym zakładamy, że obsługuje korytarz, bo jego opublikowany obszar obsługi obejmuje oba końce, liczba gramów z opublikowanego współczynnika.

Wartość wyprowadzona pozostaje wyprowadzona w pliku, na stronie nad nim i w danych strukturalnych.

Cztery zbiory danych

Uporządkowane według mocy tego, co niosą, a nie według rozmiaru.

  1. Które statki pływają między którymi portami, kiedy, kto je obsługuje i ile zażądał armator.

    Każdy z 2709 rejsów jest zmierzony: wypłynięcie, przypłynięcie, jednostka i cena w takiej postaci, w jakiej opublikowało je 120 armatorów, odczytane w czterech sprawdzanych terminach i zapisane bez zmian. Dla cen zakładamy euro.

    • 2709rejsów
    • 2190połączeń
    • 120armatorów
    • 65krajów

    Wersja 1.0.0, zbudowany na nowo 12 września 2026, wierszy: 6698Formaty: CSV, JSON

    Otwórz zbiór danych
  2. Co rozkład jazdy mówi o podróży z miasta do miasta, odcinek po odcinku, z przystankami pośrednimi i peronami.

    Wszystkie 3025 odcinki są złożone: to opublikowane plany, a nie obserwacje kursów, które pojechały. Spośród 1254 korytarzy 545 zwróciło cokolwiek.

    • 545korytarzy
    • 1035tras
    • 3025odcinków
    • 184armatorów

    Wersja 1.0.0, zbudowany na nowo 16 września 2026, wierszy: 19 195Formaty: ZIP, GTFS, CSV

    Otwórz zbiór danych
  3. Który przewoźnik obsługuje którą parę miejsc, we wszystkich środkach transportu, na całym świecie.

    164 657 z 293 523 połączeń pochodzi z opublikowanego obszaru obsługi przewoźnika obejmującego oba końce, co potwierdza, że przewoźnik obsługuje ten korytarz. Pozostałe 128 866 odczytano ze źródła danych lub z rejestru.

    • 293 523odcinków
    • 2093armatorów
    • 11 241miejsc
    • 211krajów

    Wersja 1.0.0, zbudowany na nowo 14 września 2026, wierszy: 307 072Formaty: CSV, PARQUET, JSON

    Otwórz zbiór danych
  4. Wskaźniki emisji

    Wyprowadzone

    Ile gramów CO2e niesie pasażerokilometr, według środka transportu, i skąd wziął się każdy współczynnik.

    Każda liczba to opublikowany wskaźnik pomnożony przez modelowaną odległość. 8 z 8 wierszy tabeli wskaźników odtwarza się ze źródła, które potrafimy wskazać, a tabela podaje ten status w samym wierszu.

    • 6używanych współczynników
    • 8994korytarzy obsługiwanych więcej niż jednym środkiem
    • 18 537wierszy korytarza i środka transportu
    • 114 524korytarzy w sieci

    Wersja 2.0.0, zbudowany na nowo 18 września 2026, wierszy: 18 545Formaty: CSV, JSON

    Otwórz zbiór danych

Prawdziwe dla wszystkich czterech

To, co nie zmienia się między jednym zbiorem danych a następnym.

Uznanie autorstwa, i na tym licencja się kończy
Każdy plik jest na licencji CC BY 4.0. Używaj komercyjnie, rysuj na nowo, buduj na tym, sprzedawaj to, co zbudujesz. Wymień Orlero i umieść odnośnik zwrotny.
Pakiet Frictionless Data, a nie luźny plik CSV
Każdy pakiet niesie plik datapackage.json z osobnym Table Schema dla każdego pliku, więc czytający zna typ i jednostkę każdej kolumny, zanim ją otworzy. Daty są w ISO 8601 z przesunięciem, kraje w ISO 3166-1 alpha-2, kwoty w całkowitych jednostkach podrzędnych z kodem ISO 4217, a współrzędne w WGS84.
Cztery kolumny pochodzenia w każdym wierszu
source, source_url, fetched_at i evidence, w każdej tabeli we wszystkich czterech pakietach. Wiersz wyjęty z kontekstu nadal mówi, skąd pochodzi, kiedy został odczytany i jak mocne jest jego twierdzenie.
Sumy kontrolne i dziennik zmian
Każdy pakiet zawiera plik checksums.txt z sumą SHA-256 dla każdego pliku, plik README, CHANGELOG i wersję semantyczną. Przebudowa zmieniająca znaczenie kolumny podnosi numer wersji głównej.
Brak danych to pusta komórka
Pusta komórka znaczy, że nie mamy wartości, a zero znaczy zero. Nigdy zero zamiast pustej komórki i nigdy skrót b.d.

https://creativecommons.org/licenses/by/4.0/

Jak cytować

Każda strona zbioru danych niesie własny sformatowany opis bibliograficzny i wpis BibTeX do skopiowania. Wszystkie mają jedną postać, która dla pakietu promowego brzmi tak:

Orlero (2026). Scheduled ferry crossings with operator-published fares (Version 1.0.0) [Data set]. https://orlero.com/data/ferry-crossings

Jeszcze bez DOI. Cytuj adres powyżej.

Czego tu nie ma

Luki, o których warto wiedzieć, zanim cokolwiek na tym zbudujesz.

  • Każdy pakiet to datowana migawka, a nie kanał na żywo, a data jest wydrukowana na stronie zbioru, w pliku i w danych strukturalnych.
  • Zasięg jest z założenia nierówny: migawka promowa jest gęsta wokół Morza Śródziemnego, rozkłady są europejskie, a graf przewoźników sięga najdalej i jest sprawdzany najmniej.
  • Ceny to to, co przewoźnik opublikował jednego dnia w jednym punkcie okna rezerwacyjnego. Nie są krzywą cen ani średnią.
  • Cztery pakiety budują cztery osobne skrypty z nakładających się źródeł, więc to samo miejsce może pojawić się w dwóch z nich pod dwoma identyfikatorami.
Zaplanuj z Ori

Ori, planer podróży

Zapytaj na przykład tak