开放数据

开放数据集

关于人们如何在欧洲出行的四套数据集,以文件而非图表的形式发布。每一行都说明它是实测、申报、观测还是推导得来的。

请先看证据这一列

这些文件中的每一行都带有一个 evidence 值,它决定了该行可以用来做什么。这四套数据集并不处在同一水平上。

实测
承运人在读取当日公布的出发时间、时长或价格。票价就是当时在售的票价。没有做任何推算。
报备
承运人声明该服务将如何运行。报备的出发时间是一份计划,不是观测;没有人站在站台上核对火车是否照办。
观测
某个来源看见确实开行的连接,记录在数据流或公开登记册中。因为记录来自第二手,所以弱于实测;又因为确实有车开行,所以强于推算。
推算
由我们根据其他数值推算得出:由两组坐标算出的距离;因公布的服务区域覆盖两端而被认定服务于该通道的承运商;由公开因子算出的克数。

派生值在文件中、在其上方的页面中以及在结构化数据中,始终保持为派生值。

四个数据集

按所承载内容的可靠程度排序,而非按体量。四者中体量最大的,恰恰也是最依赖推断的那一个,把它放在最后遇到才是诚实的次序。

  1. 哪些船在哪些港口之间航行、何时开行、由谁运营,以及船公司收了多少钱。

    2,709 个航次全部为实测:出发、到达、船舶和票价均按 120 家运营商公布的原样,在四个探测日期读取并原封不动地记录。票价假定以欧元计。

    • 2,709个班次
    • 2,190条航线
    • 120家运营方
    • 65个国家

    版本 1.0.0,于 2026年9月12日 重新生成,共 6,698 行格式: CSV, JSON

    打开数据集
  2. 按时刻表看,一段城际行程是什么样子,逐段列出,含停靠站与站台。

    全部 3,025 个航段均为申报:这是公布的计划,而不是对实际运行班次的观测。查询的 1,254 条通道中,有 545 条返回了内容。

    • 545条走廊
    • 1,035条行程
    • 3,025个区段
    • 184家运营方

    版本 1.0.0,于 2026年9月16日 重新生成,共 19,195 行格式: ZIP, GTFS, CSV

    打开数据集
  3. 哪家承运人经营哪一对地点,涵盖所有出行方式,覆盖全球。

    293,523 条连接中有 164,657 条来自承运方公布并覆盖两端的服务范围,可证明该承运方服务这条走廊。其余 128,866 条读取自数据源或登记册。

    • 293,523个区段
    • 2,093家运营方
    • 11,241个地点
    • 211个国家

    版本 1.0.0,于 2026年9月14日 重新生成,共 307,072 行格式: CSV, PARQUET, JSON

    打开数据集
  4. 每人公里承载多少克 CO2e,按出行方式分列,以及每个系数的出处。

    每个数值都是一个已公布的系数乘以一段建模距离。系数表 8 行中有 8 行可从我们能够指名的来源复现,表格会在该行本身标明这一状态。

    • 6个在用系数
    • 8,994条有多种出行方式的走廊
    • 18,537条走廊与方式记录
    • 114,524条网络内走廊

    版本 2.0.0,于 2026年9月18日 重新生成,共 18,545 行格式: CSV, JSON

    打开数据集

四者皆然

从一个数据集到下一个都不会改变的部分。

署名,整份许可就这一条
每个文件均为 CC BY 4.0。可用于商业用途、可重新绘制、可在其基础上构建、可销售你构建的成果。请注明 Orlero 并附上链接。
这是 Frictionless Data Package,不是零散的 CSV
每个数据包都带有 datapackage.json,并为每个文件提供一份 Table Schema,因此读者在打开文件之前就知道每一列的类型和单位。日期采用带时差的 ISO 8601,国家采用 ISO 3166-1 alpha-2,金额以 ISO 4217 代码下的整数最小单位表示,坐标采用 WGS84。
每一行都有四个来源列
source、source_url、fetched_at 与 evidence,出现在四个数据包的每一张表中。一行数据即使被抽离语境,仍然会说明它从何而来、何时读取,以及它的主张有多强。
校验和与变更记录
每个数据包都附有 checksums.txt,为每个文件给出一份 SHA-256,另有 README、CHANGELOG 和语义化版本号。若某次重建改变了某一列的含义,主版本号就会提升。
数据缺失就是空单元格
空白表示未持有该值,零就表示零。绝不用零代替空白,也绝不写 N 斜杠 A。

https://creativecommons.org/licenses/by/4.0/

如何引用

每个数据集页面都带有自己格式化好的引用文字和一条可复制的 BibTeX 条目。它们遵循同一种写法,渡轮数据包的写法如下:

Orlero (2026). Scheduled ferry crossings with operator-published fares (Version 1.0.0) [Data set]. https://orlero.com/data/ferry-crossings

暂无 DOI。请引用上面的网址。

这里没有的东西

在以此为基础做任何事之前,值得先知道的缺口。

  • 每个数据包都是带日期的快照,而不是实时数据源,该日期会印在数据集页面、文件和结构化数据中。
  • 覆盖范围本就不均衡。渡轮快照在地中海一带最密集,时刻表限于欧洲,而承运人关系图所及的范围超出了其中任何内容可被核对的范围。
  • 票价是承运人在某一天、预订窗口的某一时点所公布的价格。它既不是价格曲线,也不是平均值。
  • 这四个数据包由四个独立脚本基于相互重叠的数据源构建,因此同一个地点可能在其中两个包里以两个标识符出现。
用 Ori 规划

Ori,行程规划助手

可以这样问它