खुले आँकड़े

खुले डेटासेट

यूरोप में लोग कैसे आते-जाते हैं, इस पर चार डेटासेट, जो चार्ट के बजाय फ़ाइलों के रूप में प्रकाशित हैं। हर पंक्ति बताती है कि वह मापी गई, दाख़िल की गई, देखी गई या निकाली गई।

पहले प्रमाण वाला स्तंभ पढ़िए

इन फ़ाइलों में से हर एक की हर पंक्ति एक evidence मान रखती है, और वही तय करता है कि उस पंक्ति का उपयोग किस लिए हो सकता है। चारों डेटासेट एक ही स्तर पर नहीं हैं।

मापा हुआ
प्रस्थान, अवधि या मूल्य ठीक वैसा जैसा संचालक ने पढ़ने के दिन प्रकाशित किया था। किराया वही है जो बिक्री पर था। कुछ भी गिना नहीं गया।
दाख़िल
संचालक जो कहता है कि सेवा करेगी। दाख़िल प्रस्थान एक योजना है, प्रेक्षण नहीं, और किसी ने प्लेटफ़ॉर्म पर खड़े होकर यह नहीं जाँचा कि गाड़ी ने उसे निभाया या नहीं।
प्रेक्षित
ऐसा संपर्क जिसे किसी स्रोत ने चलते देखा और जो किसी डेटा धारा या सार्वजनिक रजिस्टर में दर्ज हुआ। मापे हुए से कमज़ोर, क्योंकि अभिलेख दूसरे हाथ का है, और निकाले हुए से मज़बूत, क्योंकि कुछ सचमुच चला।
निकाला हुआ
हमने अन्य मानों से निकाला: दो निर्देशांक जोड़ों से एक दूरी, एक वाहक जिसके बारे में यह माना गया कि वह किसी कॉरिडोर की सेवा करता है क्योंकि उसका प्रकाशित सेवा क्षेत्र दोनों छोरों को कवर करता है, और किसी प्रकाशित कारक से ग्राम की गणना।

कोई निकाला गया मान फ़ाइल में, उसके ऊपर के पृष्ठ में और संरचित डेटा में निकाला गया ही रहता है।

चारों डेटासेट

आकार के हिसाब से नहीं, बल्कि जो वे उठाए हुए हैं उसकी मज़बूती के हिसाब से क्रम में हैं। चारों में सबसे बड़ा वही है जो सबसे ज़्यादा अनुमान पर टिका है, और उससे सबसे आख़िर में मिलना ईमानदार क्रम है।

  1. किन बंदरगाहों के बीच कौन-से जहाज़ चलते हैं, कब, किसके संचालन में, और संचालक ने कितना लिया।

    2,709 सैलिंग में से हर एक मापी गई है: प्रस्थान, आगमन, जहाज़ और किराया वैसे ही जैसे 120 संचालकों ने उन्हें प्रकाशित किया, चार जाँची गई तिथियों पर पढ़े गए और बिना बदले लिखे गए। किराए यूरो में माने गए हैं।

    • 2,709यात्राएँ
    • 2,190जलमार्ग
    • 120संचालक
    • 65देश

    संस्करण 1.0.0, 12 सितंबर 2026 को फिर से तैयार, 6,698 पंक्तियाँप्रारूप: CSV, JSON

    डेटासेट खोलें
  2. समय-सारणी के अनुसार शहर से शहर की यात्रा कैसी दिखती है, चरण दर चरण, बीच के ठहरावों और प्लेटफ़ॉर्मों सहित।

    सभी 3,025 लेग दाख़िल हैं: प्रकाशित योजनाएँ, न कि चली हुई सेवाओं के अवलोकन। 1,254 कॉरिडोर में से 545 ने कुछ भी लौटाया।

    • 545गलियारे
    • 1,035यात्रा-क्रम
    • 3,025चरण
    • 184संचालक

    संस्करण 1.0.0, 16 सितंबर 2026 को फिर से तैयार, 19,195 पंक्तियाँप्रारूप: ZIP, GTFS, CSV

    डेटासेट खोलें
  3. ऑपरेटर कवरेज

    निकाला हुआ

    कौन-सा वाहक किन दो स्थानों के बीच सेवा देता है, हर साधन में, पूरी दुनिया में।

    2,93,523 में से 1,64,657 संपर्क किसी संचालक के प्रकाशित सेवा क्षेत्र से आते हैं जो दोनों छोरों को समेटता है, जो दर्शाता है कि वह वाहक इस गलियारे पर सेवा देता है। शेष 1,28,866 किसी फ़ीड या रजिस्टर से पढ़े गए हैं।

    • 2,93,523चरण
    • 2,093संचालक
    • 11,241स्थान
    • 211देश

    संस्करण 1.0.0, 14 सितंबर 2026 को फिर से तैयार, 3,07,072 पंक्तियाँप्रारूप: CSV, PARQUET, JSON

    डेटासेट खोलें
  4. उत्सर्जन कारक

    निकाला हुआ

    एक यात्री-किलोमीटर कितने ग्राम CO2e ढोता है, साधन के अनुसार, और हर गुणक कहाँ से आया।

    हर आंकड़ा एक प्रकाशित गुणक को एक मॉडल की गई दूरी से गुणा करके निकला है। गुणक तालिका की 8 पंक्तियों में से 8 ऐसे स्रोत से दोबारा बनाई जा सकती हैं जिसका नाम हम बता सकते हैं, और तालिका यह स्थिति उसी पंक्ति में दर्ज करती है।

    • 6प्रयोग में गुणक
    • 8,994एक से अधिक साधन वाले गलियारे
    • 18,537गलियारा और साधन पंक्तियाँ
    • 1,14,524नेटवर्क में गलियारे

    संस्करण 2.0.0, 18 सितंबर 2026 को फिर से तैयार, 18,545 पंक्तियाँप्रारूप: CSV, JSON

    डेटासेट खोलें

चारों पर लागू

वे हिस्से जो एक डेटासेट से दूसरे तक नहीं बदलते।

श्रेय, और पूरा लाइसेंस बस इतना ही
हर फ़ाइल CC BY 4.0 है। इसका व्यावसायिक उपयोग करें, इसे फिर से बनाएँ, इस पर निर्माण करें, जो बनाएँ उसे बेचें। Orlero का नाम दें और वापस लिंक करें।
यह एक Frictionless Data Package है, कोई अकेली CSV नहीं
हर पैकेज में हर फ़ाइल के लिए एक Table Schema सहित datapackage.json होता है, ताकि पढ़ने वाला खोलने से पहले ही हर स्तंभ का प्रकार और इकाई जान ले। तिथियाँ ऑफ़सेट सहित ISO 8601 में, देश ISO 3166-1 alpha-2 में, राशियाँ ISO 4217 कोड के साथ पूर्णांक लघु इकाइयों में और निर्देशांक WGS84 में हैं।
हर पंक्ति में चार स्रोत स्तंभ
source, source_url, fetched_at और evidence, चारों पैकेजों की हर तालिका में। संदर्भ से अलग की गई पंक्ति भी यह बताती रहती है कि वह कहाँ से आई, कब पढ़ी गई और उसका दावा कितना मज़बूत है।
चेकसम और परिवर्तन-सूची
हर पैकेज में हर फ़ाइल के लिए SHA-256 वाली checksums.txt, एक README, एक CHANGELOG और एक सिमैंटिक संस्करण होता है। जिस पुनर्निर्माण से किसी स्तंभ का अर्थ बदलता है, उसमें मुख्य संस्करण आगे बढ़ता है।
अनुपलब्ध आँकड़ा एक खाली खाना है
रिक्त का अर्थ है कि वह मान नहीं रखा गया, और शून्य का अर्थ है शून्य। रिक्त की जगह कभी शून्य नहीं, और कभी N स्लैश A अक्षर नहीं।

https://creativecommons.org/licenses/by/4.0/

उद्धरण कैसे दें

हर डेटासेट पृष्ठ पर उसका अपना सजाया हुआ उद्धरण और नकल करने लायक एक BibTeX प्रविष्टि है। ये सब एक ही रूप का पालन करते हैं, जो फेरी पैकेज के लिए इस तरह पढ़ा जाता है:

Orlero (2026). Scheduled ferry crossings with operator-published fares (Version 1.0.0) [Data set]. https://orlero.com/data/ferry-crossings

अभी कोई DOI नहीं। ऊपर दिया URL उद्धृत करें।

यहाँ जो नहीं है

इस पर कुछ खड़ा करने से पहले जान लेने लायक कमियाँ।

  • हर पैकेज किसी लाइव फ़ीड के बजाय एक तिथि-अंकित स्नैपशॉट है, और वह तिथि डेटासेट पृष्ठ पर, फ़ाइल में और संरचित डेटा में छपी होती है।
  • कवरेज जान-बूझकर असमान है। फेरी की झलक भूमध्यसागर के आसपास सघन है, समय-सारणियाँ यूरोपीय हैं, और संचालक ग्राफ़ उससे कहीं आगे तक जाता है जितना उसके भीतर किसी बात की जाँच हो सकती है।
  • किराए वही हैं जो किसी संचालक ने बुकिंग अवधि के किसी एक बिंदु पर, किसी एक दिन प्रकाशित किए। ये न किराया वक्र हैं और न औसत।
  • चारों पैकेज चार अलग-अलग स्क्रिप्ट द्वारा अतिव्यापी स्रोतों से बनाए जाते हैं, इसलिए कोई स्थान उनमें से दो में दो पहचानकर्ताओं के साथ आ सकता है।
Ori के साथ योजना बनाएँ

Ori, सफ़र की योजना बनाने वाला

इससे कुछ ऐसा पूछें