Lingua Mundi: Building a Language-Agnostic Map of Meaning from Open Lexical Data
One idea in every language, on one star.
A project history and technical account · प्रारंभिक एआई-जनित मसौदा · RHLS स्टूडियो · 7 सितंबर 2026
RHLS स्टोर · Lingua Mundi · ब्लॉग · अंग्रेज़ी ऑडियो · English · Español · Français · Deutsch · Italiano · Português · 日本語 · 한국어 · 简体中文 · 繁體中文 · 廣東話 · हिन्दी · العربية
Notice — preliminary AI-generated draft. This document was drafted by an artificial-intelligence research agent (operating inside the RHLS "DeepSeek Harness" toolchain) at the direction of Raciel Hernández Hernández, the project's author. It is not the final publication: the authoritative, human-authored paper is still in development by Mr. Hernández. Every fact, figure, and quotation in this draft traces to a dated primary source (conversation logs with ChatGPT, Claude, and DeepSeek; project journals and session logs; the software repository and its documentation; and direct measurements of the live database and application programming interface), and the sources are listed in the appendix. Statements that could not be verified are explicitly marked. No claim in this draft should be treated as peer-reviewed or as final wording.
How to read this paper. यह उन लोगों के लिए लिखा गया है जो not कम्प्यूटेशनल भाषाविद् और not प्रोग्रामर हैं। जब कोई तकनीकी शब्द पहली बार आता है तो उसे बिंदीदार अंडरलाइन से चिह्नित किया जाता है: साधारण भाषा में परिभाषा के लिए उस पर होवर करें (या टैप करें), या पूरी शब्दावली (परिशिष्ट B) पर जाने के लिए उस पर क्लिक करें। प्रत्येक उद्धरण और प्रत्येक नामित उपकरण या डेटा स्रोत को उसके प्राथमिक स्रोत या आधिकारिक दस्तावेज़ीकरण से जोड़ा गया है। जो पाठक केवल कहानी पढ़ना चाहते हैं, वे अनुभाग 1–3 और 10 पढ़ सकते हैं; मध्य के अनुभागों में इंजीनियरिंग का विस्तार से दस्तावेजीकरण किया गया है।
Author and contribution statement. Lingua Mundi की संकल्पना, डिजाइन, और इसे रेसिएल हर्नांडेज़ हर्नांडेज़ द्वारा बनाया जा रहा है, जो मेक्सिको के टाबास्को में स्थित एक स्वतंत्र शोधकर्ता और अनुवादक हैं। इसका विकास वाणिज्यिक बड़े भाषा मॉडल — OpenAI के ChatGPT, Anthropic के Claude, और DeepSeek के चैट और तर्क मॉडल — जिनका उपयोग लेखक प्रोग्रामिंग भागीदारों, समीक्षकों, और दस्तावेज़ीकरण सहायकों के रूप में करता है। यह मसौदा स्वयं लेखक के निर्देशन में एक एआई एजेंट द्वारा लिखा गया था और यह स्टूडियो की सत्यापन परंपराओं का पालन करता है: [H] एक ऐसे तथ्य को दर्शाता है जिसे एक तिथि वाले स्रोत, माप, या कोड के विरुद्ध सत्यापित किया गया है; [O] किसी विशेषीकृत व्याख्या या राय को दर्शाता है; [NV] एक ऐसे बयान को दर्शाता है जिसे सत्यापित नहीं किया जा सका। सार्वजनिक पाठ, स्टूडियो की परंपरा के अनुसार, लेखक की व्यक्तिगत आवाज़ के बजाय स्टूडियो की आवाज़ में लिखा जाता है।
[H] Studio-voice rule (session log, 7 September 2026): "Studio/PR voice on all external/pitch copy — never Rex's personal voice." [H] Honesty rule: "No lies / no fake confidence" (studio conventions, September 2026).
Abstract
मानव शब्दकोश और वर्डनेट by language व्यवस्थित हैं: एक स्पेनिश शब्द फ़ाइल, एक अंग्रेजी, एक जापानी। लेकिन "घरेलू बिल्ली" जैसा कोई अर्थ स्पेनिश, अंग्रेजी या जापानी नहीं है — यह उन सभी में साझा है, और प्रत्येक भाषा केवल एक अलग सतही रूप के साथ इसकी ओर इशारा करती है: gato, cat, chat, Katze, 猫। Lingua Mundi ("विश्व भाषा") एक खुला, मुफ्त, और भाषा-तटस्थ शब्दावली ज्ञान आधार है जो सामान्य संगठन को उलटने का प्रयास करता है: प्रत्येक भाषा के लिए शब्दकोशों के बजाय, यह concepts संग्रहीत करता है (अर्थ) एक बार संग्रहीत करता है, और प्रत्येक भाषा के शब्दों को उन साझा अर्थों से जोड़ता है, जिसमें संरेखण कुंजी के रूप में ओपन-डेटा समुदाय के बहुभाषी वर्डनेट का उपयोग किया जाता है। यह परियोजना एक ही व्यक्ति द्वारा, एक ही 2014-के-युग का लैपटॉप (एक चार-कोर इंटेल पेंटियम-क्लास प्रोसेसर, 8 जीबी रैम, एक 5400 आरपीएम हार्ड डिस्क, और एक धीमी इंटरनेट कनेक्शन — वह मशीन जो लाइव सिस्टम को होस्ट करती है, जिसे इस पेपर के लिए सीधे कैप्चर किया गया है; अनुभाग 9.1 देखें), शून्य बजट के साथ, केवल खुले शब्दावली डेटा का उपयोग करके विकसित किया गया है। दिसंबर 2025 और सितंबर 2026 के बीच यह परियोजना डाउनलोड की गई शब्दकोश फ़ाइलों के एक फ़ोल्डर से बढ़कर 96,434 concepts, 1,238,383 word forms (lexemes), के एक कामकाजी PostgreSQL डेटाबेस में बदल गई, 1,608,018 word senses, और 171,672 semantic relations छह लाइव भाषाओं (अंग्रेजी, स्पेनिश, फ्रेंच, जर्मन, पुर्तगाली, और जापानी) में, एक क्वेरी API जो मिलीसेकंड में जवाब देती है, और एक वेब इंटरफ़ेस जिसे "अर्थ का नक्शा" के रूप में स्टाइल किया गया है — एक खोजने योग्य तारामंडल जिसमें एक तारा एक साथ cat · gato · 猫 · chat · Katze हो सकता है। यह पेपर परियोजना की बौद्धिक उत्पत्ति (यह अंतर्ज्ञान कि बहुभाषी भाषा डेटा की प्राकृतिक इकाई वर्तनी नहीं, बल्कि अर्थ है) को प्रलेखित करता है; इसके डिज़ाइन के गणितीय और भाषाई सिद्धांत (एक भाषा-तटस्थ इकाई मॉडल, सिंसेट-आधारित अवधारणा संरेखण, प्रकारित संबंधों का एक वर्गीकरण, ज़िप्फ़ियन रैंकिंग, और डेटाबेस अभ्यास से लिया गया "बेक, दोबारा व्युत्पन्न न करें" मटीरियलाइज़्ड-व्यू पैटर्न); खुले डेटा स्रोतों और उनके लाइसेंस; इसे बनाने के लिए उपयोग किए गए उपकरणों और मानव-एआई वर्कफ़्लो; उपयोगकर्ता इंटरफ़ेस और इसके शैक्षिक डिज़ाइन; इस प्रक्रिया में खोजी गई अवसंरचना विफलताओं — जिसमें एक साइलेंट ट्रंकेशन बग भी शामिल है जिसने थोड़े समय के लिए अंग्रेजी शब्द cat को अपने ही अवधारणा से अदृश्य (इसकी मरम्मत श्रृंखला, जिसे 7 सितंबर 2026 को लॉन्च किया गया और 8 सितंबर 2026 को सत्यापित और पूर्ण घोषित किया गया); परियोजना की वर्तमान स्थिति; और इसकी योजनाएँ। यह पेपर, निहित रूप से, इस बात का एक केस स्टडी भी है कि एक दृढ़ निश्चयी व्यक्ति ओपन डेटा के साथ मुफ्त टूल और उधार की कंप्यूटेशन से क्या बना सकता है — और उन इंजीनियरिंग आदतों (मापना, तारीख डालना, लेबल लगाना, जो अप्रमाणित है उसे स्वीकार करना) के बारे में जो एक छोटे प्रोजेक्ट को इतना ईमानदार बनाती हैं कि वह एक बड़े प्रोजेक्ट में विकसित हो सके।
इस सार में आंकड़े और सांख्यिकी 6–7 सितंबर 2026 को मापे गए थे; सटीक क्वेरीज़, दिनांकों और स्रोतों के लिए परिशिष्ट A देखें।
1 · The intuition: why dictionaries are the wrong shape
princeton-wordnet:02121620-n (verified subset, September 2026).हर भाषा सीखने वाले ने इस असुविधा को महसूस किया है। आप अंग्रेजी-स्पेनिश शब्दकोश में cat को खोजते हैं और आपको gato मिलता है। आप स्पेनिश-जापानी शब्दकोश में gato को खोजते हैं और आपको 猫 मिलता है। तीन शब्दकोशों के बाद आपने एक दोपहर यह पुष्टि करने में बिता दी है कि जो आप पहले से ही संदेह कर रहे थे: एक ही विचार — एक छोटा पालतू मांसाहारी जो घुरघुराता है — का वर्णन तीन अलग-अलग फाइलों में, तीन अलग-अलग संगठनों द्वारा, तीन अलग-अलग पहचानकर्ताओं के साथ किया जा रहा है, और कभी भी बाकी दो से नहीं जोड़ा गया।
Lingua Mundi के पीछे का अंतर्ज्ञान यह है कि यह भाषाई डेटा के लिए गलत आकार है। अर्थ एक बार ही मौजूद होता है। शब्द कई बार मौजूद होते हैं। एक ऐसा डेटाबेस जो meanings को प्रथम-श्रेणी के ऑब्जेक्ट के रूप में संग्रहीत करता है, और words को उन अर्थों से विभिन्न भाषाओं द्वारा जोड़े गए लेबल के रूप में मानता है, एक व्यक्ति को (या एक प्रोग्राम) एक ही साझा मानचित्र के माध्यम से किसी भी भाषा से किसी अन्य भाषा में जा सकता है — और यह एक सीखने वाले को एक नज़र में यह देखने देगा कि cat, gato, chat, Katze, and 猫 याद करने के लिए पाँच तथ्य नहीं हैं, बल्कि एक ही तथ्य है जो पाँच रूपों में प्रकट होता है।
यह अंतर्ज्ञान किसी वज्रपात की तरह नहीं आया। यह लगभग एक साल के दौरान, एक विशेष व्यक्ति के दैनिक कार्य से विकसित हुआ — और इसका सबसे पहला दस्तावेजी प्रमाण आश्चर्यजनक रूप से साधारण है।
1.1 The first message
3 December 2025 पर, लेखक ने ChatGPT के साथ एक बातचीत शुरू की और निम्नलिखित टाइप किया (शब्दशः उद्धृत; बातचीत साढ़े चार महीने तक खुली रही और इसे आखिरी बार 21 अप्रैल 2026 को संपादित किया गया था) [H]:
"I want to find free dictionaries similar to JMDICT and Kanjidict2 for the following languages: Spanish, English, French, Italian, Portuguese, Chinese, Korean and Vietnamese. My intent is to create a unified multilingual database for various purposes. I'm also interested in knowing if similar databases exist for indigenous Mexican languages that I can freely access."
(सत्र लॉग, ChatGPT, बातचीत "निःशुल्क बहुभाषी शब्दकोश", 2025-12-03; स्रोत फ़ाइल परिशिष्ट A में उद्धृत।)
उस संक्षिप्त संदेश में तीन बातों ने उस परियोजना की भविष्यवाणी की जो बाद में बनी। सबसे पहले, नामित भाषाएँ — स्पेनिश, अंग्रेजी, फ्रेंच, इतालवी, पुर्तगाली, और, बाद में, जापानी — बिल्कुल वही भाषाएँ हैं जो लेखक एक अनुवादक और भाषा शिक्षक के रूप में बोलते और जिनके साथ काम करते हैं (एक समूह जिसे उन्होंने बाद में "Core 6" के रूप में औपचारिक रूप दिया), साथ ही चीनी, कोरियाई और वियतनामी, जिन्हें वह अगला जोड़ने की योजना बना रहे थे। दूसरा, "एक unified बहुभाषी डेटाबेस" वाक्यांश पहले से ही लक्ष्य का नाम बताता है: छह शब्दकोश नहीं, बल्कि एक डेटाबेस जो उन सभी को एक साथ रखता है। तीसरा, लेखक पहले दिन से ही indigenous Mexican languages के बारे में सोच रहा था — एक ऐसा विषय जो बार-बार सामने आता है (अगस्त 2026 [H] में Lingua Mundi के लिए एक माया-भाषा एकीकरण का पता लगाया गया था, और माया-भाषा के संसाधन उसके शोध नोट्स में हर जगह दिखाई देते हैं)।
उस संदेश के पीछे का संदर्भ भी मायने रखता है। लेखक प्रशिक्षण से कंप्यूटर वैज्ञानिक नहीं हैं। वह एक अनुवादक और भाषा शिक्षक हैं जो उस समय गंभीरता से जापानी भी सीख रहे थे, और उस सीखने को आसान बनाने के लिए छोटे-छोटे उपकरण बना रहे थे: कांजी और काना सीखने के खेल और एक जापानी शब्दकोश पाइपलाइन (जापानी ई-पुस्तकों के लिए एक फुरिगाना संपादक इस उपकरण-संग्रह में शामिल होगा बाद में, 2026 में, उस परियोजना के रूप में जो Shikibu ऐप बनी)। 2025 के अंत में उनकी होम डायरेक्टरी उस सीखने की पुरातात्विक झलक दिखाती है: 11 November 2025 पर डाउनलोड की गई KANJIDIC2 कांजी शब्दकोश फ़ाइल की एक प्रति, एक Joyo कांजी सूची दिसंबर, और फिर — उस 3 दिसंबर की बातचीत से प्रेरित होकर — 5 December पर [H] से डाउनलोड किया गया Open Multilingual Wordnet डेटा (फ़ाइल टाइमस्टैम्प, /home/rex/; परिशिष्ट A देखें)। दूसरे शब्दों में, 3 दिसंबर की ChatGPT बातचीत ही वह मोड़ है: वह क्षण जब "मुझे अपने टूल के लिए जापानी डेटा चाहिए" का दायरा बढ़कर "मैं अपने देश की भाषाओं सहित कई भाषाओं के लिए, मुफ्त में, एक एकीकृत बहुभाषी डेटाबेस बनाना चाहता हूँ" हो गया।
1.2 From dictionaries to meanings: the December 2025 pipeline
लेखक ने आगे क्या किया, यह उसके द्वारा बनाई गई फ़ाइलों में देखा जा सकता है। 5 दिसंबर और 16 दिसंबर 2025 के बीच उसने ChatGPT को प्रोग्रामिंग पार्टनर बनाकर Python स्क्रिप्ट्स की एक छोटी पाइपलाइन लिखी — extract_omw.py, merge_dicts.py, unified_dictionary_pipeline.py, crossref_deterministic.py — जिसने कई खुले स्रोतों से शब्दात्मक डेटा डाउनलोड, पार्स और मर्ज करके उसे क्रमबद्ध रूप से अधिक संरचित रूप [H] (/home/rex/ में स्क्रिप्ट और दिनांक) में परिवर्तित किया। इस अवधि का सबसे महत्वपूर्ण डिज़ाइन निर्णय स्वयं फ़ाइलों में प्रलेखित है: पाइपलाइन का अंतिम चरण, जिसकी तारीख 16 दिसंबर है, प्रत्येक प्रविष्टि को four kinds of objects में विभाजित करता है — concept, sense, lexeme, और grapheme (एक ग्रैफ़ीम एक लिखित अक्षर होता है जैसे कि कांजी) — और उन्हें डिस्क पर JSON लाइन्स दस्तावेज़ों के रूप में लिखता है। यह योजना बहुत कुछ बयां करती है: एक sense किसी विशेष शब्द का किसी विशेष शब्दकोश में एक विशेष अर्थ है; एक concept वह साझा विचार है जिसकी ओर कई भाषाओं में कई अर्थ इशारा करते हैं; और concept_id किसी अर्थ के क्षेत्र को empty होने की अनुमति है — जिसका अर्थ है "इस शब्द के अर्थ को अभी तक किसी साझा अवधारणा से नहीं जोड़ा गया है।" उस कोड में लेखक के नोट्स इस विधि को "शून्य ह्यूरिस्टिक्स" के रूप में वर्णित करते हैं: कोई धुंधली अनुमान नहीं, यह तय करने के लिए कोई सांख्यिकीय समानता की तरकीब नहीं कि दो शब्दों का मतलब एक ही है; केवल स्पष्ट, प्रलेखित लिंक। [H] (पाइपलाइन कोड और एनोटेशन, /home/rex/, दिसंबर 2025; विवरण परिशिष्ट A में।)
वह 16-दिसंबर की रूपरेखा, संक्षेप में, उस परियोजना की पूरी संरचना है जिसे बाद में Lingua Mundi कहा जाएगा: शब्द भाषाओं में जीवित रहते हैं; अर्थ एक साझा स्थान में जीवित रहते हैं; और कठिन, ईमानदार समस्या — कि कौन सी भाषा में कौन सा शब्द किस अवधारणा का अर्थ रखता है — को कभी भी झूठा नहीं बनाया जाता। एक ऐसी भावना जिसे किसी अवधारणा से नहीं जोड़ा गया है, उसे चुपचाप किसी स्थान पर अनुमान लगाकर भरने के बजाय, डेटाबेस में स्पष्ट रूप से अनलिंक्ड (unlinked) रखकर रखा जाता है। दस महीने बाद, जब एक इम्पोर्ट पाइपलाइन में बग के कारण अंग्रेजी शब्द cat अपने कॉन्सेप्ट के लिए अदृश्य हो गया, तो लेखक ने इस सिद्धांत का वर्णन बिल्कुल इन्हीं शब्दों में किया: किसी अनाथ को छिपाने से बेहतर है उसे दिखाना ([H]; देखें अनुभाग 7)।
1.3 The gap, and the widening
फिर कागजी कार्रवाई लगभग पाँच महीनों के लिए शांत हो जाती है — दिसंबर 2025 के मध्य से मई 2026 के अंत तक, उपलब्ध लॉग में कोई डिक्शनरी-पाइपलाइन का काम [NV] नहीं है। छात्रों को पढ़ाने वाले एक कामकाजी अनुवादक के लिए यह असामान्य नहीं है, लेकिन यह स्पष्ट रूप से कहना उचित है: परियोजना का विकास not निरंतर था। यह अन्य कामों से अलग, कुछ हफ्तों या महीनों के अंतराल पर झटकों में आगे बढ़ी — एक लय जो पूरे 2026 में जारी रही।
जब थ्रेड फिर से शुरू होता है, तो महत्वाकांक्षा व्यापक हो गई है। 1 May 2026 पर लेखक "OMW v2.0 डेटा कवरेज" (Open Multilingual Wordnet रिलीज) का अध्ययन कर रहे हैं [H] (संवाद का शीर्षक और सामग्री, ChatGPT, 2026-05-01). पर 27 May 2026 वह "ओपन सोर्स भाषा" शीर्षक से एक बातचीत शुरू करता है संसाधन" और प्रभावी रूप से, प्रत्येक मुफ्त शब्दावली, व्याकरण संबंधी और अर्थ संबंधी संसाधन का एक व्यवस्थित मानचित्र मांगता है जो एक बहुभाषी ज्ञान आधार को खिला सकता है [H] (ChatGPT, 2026-05-27)। अब तक इस परियोजना का एक नाम और एक आकार हो गया है; दोनों के प्रमाण अगले अध्याय में मिलते हैं।
1.4 Why this matters beyond one person's project
एक पाठक यह सोच सकता है कि किसी पेपर में किसी व्यक्तिगत परियोजना के अंतर्ज्ञान को इतनी लंबी व्याख्या क्यों दी जाए। इसका उत्तर यह है कि यही अंतर्ज्ञान योगदान है। यह विचार कि ज़ेडक्यूएक्स0क्यूज़ (meanings) — वर्तनी नहीं — बहुभाषी डेटा की प्राकृतिक इकाई हैं, एक लंबी अकादमिक पृष्ठभूमि रखता है (यह मशीन अनुवाद की "इंटरलिंगुआ" परंपरा का सबसे पुराना सपना और ज़ेडक्यूएक्स2क्यूज़ (Princeton WordNet) के सिनसेट्स का संगठनात्मक सिद्धांत है; अनुभाग 2 देखें), लेकिन बजट के बिना, किसी व्यक्ति द्वारा इसे सार्वजनिक भलाई के लिए लागू करना दुर्लभ है। इस सिद्धांत का पालन करने वाले अधिकांश बहुभाषी संसाधन — ओपन मल्टीलिंगुअल वर्डनेट, बाबेलनेट, Universal Dependencies परियोजना — अनुदान वित्तपोषण वाले विश्वविद्यालय संघों द्वारा बनाए जाते हैं। Lingua Mundi एक स्वतंत्र शोधकर्ता का प्रयास है, जो केवल खुले डेटा और मुफ्त उपकरणों का उपयोग करके, उस बुनियादी ढांचे का एक हिस्सा स्वयं बनाने का प्रयास कर रहा है, अपने स्वयं के अनुवाद और शिक्षण कार्य के लिए, और उसे नि:शुल्क उपलब्ध कराने का। क्या वह प्रयास सफल होता है, यह एक ऐसा सवाल है जिसका निर्णय पाठक इस लेख के बाकी हिस्सों में दिए गए साक्ष्यों से लगा सकता है — और लेखक के अपने जर्नल दिखाते हैं कि वह शुरू से ही यही सवाल, इसी ईमानदारी के साथ पूछता रहा है (देखें अनुभाग 4.3)।
2 · Background: what "a map of meaning" means
यह समझने के लिए कि Lingua Mundi क्या बनाने की कोशिश कर रहा है, और इसमें वास्तव में क्या नया है, पिछले काम के तीन पहलू महत्वपूर्ण हैं: वह भाषाई विचार कि अर्थ को वर्तनी से अलग किया जा सकता है; कंप्यूटेशनल विचार कि इस तरह के अर्थ को डेटा के रूप में संग्रहीत किया जा सकता है और भाषाओं के पार जोड़ा जा सकता है; और आधुनिक अवलोकन कि अर्थ का एक संरचित मानचित्र न्यूरल भाषा मॉडल के साथ प्रतिस्पर्धा करने के बजाय उन्हें पूरक बनाता है।
2.1 The sign and its two faces
आधुनिक भाषाविज्ञान एक धोखे से सरल प्रतीत होने वाले अवलोकन से शुरू होता है, जिसका श्रेय आमतौर पर फर्डिनेंड डी सोस्यूर के बीसवीं सदी की शुरुआत के व्याख्यानों को दिया जाता है: एक शब्द एक sound/shape ("संकेतक") और एक concept ("संकेतित") की जोड़ी है। (de Saussure, 1916/1983)। इस दृष्टिकोण से, दो भाषाएँ ऐसे शब्द-समूह नहीं हैं जो संयोगवश अनुवादित हो जाते हैं; वे signifiers के दो समूह हैं जो signifieds के एक साझा क्षेत्र में आंशिक रूप से एक-दूसरे में मिलते हैं। अंग्रेज़ी संकेतक cat और स्पेनिश संकेतक gato एक ही संकेतित के साथ विभिन्न रूप हैं। यदि कोई मशीन एक बार अर्थों को संग्रहीत कर सके और उन्हें संकेतकों से जोड़ सके, तो अनुवाद एक साझा मध्यस्थ के माध्यम से एक खोज बन जाएगा — यह एक ऐसा विचार है जिसे मशीन अनुवाद में interlingua दृष्टिकोण के रूप में जाना जाता है: सीधे अंग्रेजी→स्पेनिश अनुवाद करने के बजाय, अंग्रेजी→अर्थ→स्पेनिश अनुवाद करें।
इंटरलिंग्वा का सपना मशीन अनुवाद अनुसंधान में एक लंबे इतिहास वाला है और पूर्ण सामान्यता में बार-बार बहुत कठिन साबित हुआ है। (भाषाएँ अर्थ को एकसमान टुकड़ों में नहीं बाँटतीं, और हर अनुवादक जानता है कि cat जानवर और cat जैज़ संगीतकार एक ही संकेतक को धारण करने वाले अलग-अलग संकेतित हैं)। लेकिन यह सपना कभी खत्म नहीं हुआ; इसे बस कुछ ऐसा बनाने योग्य बनाने के लिए सीमित कर दिया गया: शब्दकोश, भाषा का वह हिस्सा जो स्थिर, साझा अर्थों के साथ सबसे अच्छी तरह मेल खाता है।
2.2 WordNet and the synset
निर्णायक संकुचन मनोविज्ञान और शब्दकोश-लेखन से आया। 1980 और 1990 के दशकों में, प्रिंसटन में जॉर्ज मिलर और उनके सहयोगियों ने WordNet का निर्माण किया, जो अंग्रेजी के लिए एक शब्दकोशीय डेटाबेस था, जिसे वर्णानुक्रम में नहीं बल्कि semantically के अनुसार व्यवस्थित किया गया था। (Miller, 1995; Fellbaum, 1998)। WordNet की मुख्य खोज synset है (जो "समानार्थी सेट" का संक्षिप्त रूप है): शब्दों का एक समूह जो किसी संदर्भ में एक ही अर्थ का प्रतिनिधित्व कर सकता है। सिनसेट {cat, true cat, Felis catus, domestic cat} is one meaning; the synset {cat, kat, guy, hombre} — जिसका अर्थ "किसी युवक या पुरुष के लिए एक अनौपचारिक शब्द" है — एक और, काफी अलग अर्थ है जो संयोग से संकेतक cat को साझा करता है। WordNet सिन्सेट के बीच relations को भी दर्ज करता है — सबसे महत्वपूर्ण is-a पदानुक्रम (हाइपरनीमी: एक घरेलू बिल्ली is an एक स्तनधारी, एक स्तनधारी is an एक मांसाहारी, एक मांसाहारी is an* एक कशेरुकी…) — जिससे शब्दकोश एक ग्राफ़ में बदल जाता है, जिसमें अर्थ नोड के रूप में और टाइप्ड संबंध एज के रूप में होते हैं।
WordNet तीन कारणों से Lingua Mundi के लिए महत्वपूर्ण है। पहला, इसने यह साबित किया कि अर्थ के अनुसार व्यवस्थित एक मशीन-पठनीय शब्दकोश व्यवहार्य और अत्यधिक उपयोगी है — आधुनिक सर्च इंजन, स्पेल चेकर और प्राकृतिक-भाषा लाइब्रेरी आज भी इसी पर निर्भर करती हैं। दूसरा, इसने दुनिया को अर्थों के लिए एक स्थिर पहचान प्रणाली दी: Princeton WordNet अपने समानार्थक समूहों (synsets) को क्रमांकित करता है, इसलिए 02121620-n का निस्संदेह अर्थ "घरेलू बिल्ली" है और इसका विभिन्न डेटाबेस में हवाला दिया जा सकता है। तीसरा, यह एक बहुभाषी परियोजना का आधार बना: Open Multilingual Wordnet (OMW)।
2.3 The Open Multilingual Wordnet: one meaning, many languages
OMW, जिसे फ्रांसिस बॉन्ड और रयान फोस्टर (Bond & Foster, 2013) द्वारा लॉन्च किया गया था, कई भाषाओं में बनाए गए वर्डनेट्स को एकत्र करता है और उन्हें प्रिंसटन अंग्रेजी वर्डनेट के साथ संरेखित करता है: प्रत्येक सहभागी भाषा के सिन्सेट्स में उन अंग्रेजी सिन्सेट्स के पॉइंटर्स होते हैं जिनसे वे संबंधित हैं। परिणाम वह संसाधन है जिसने Lingua Mundi को संभव बनाया: "स्पेनिश gato (अर्थ 1) अंग्रेजी domestic-cat synset 02121620-n के समान अर्थ से संबंधित है" के रूप में स्पष्ट, मानव-निर्मित कथनों का एक सेट। जब Lingua Mundi के लेखक ने अपनी जुलाई 2026 की इंजीनियरिंग विनिर्देश में लिखा कि यह परियोजना "सिनसेट-केंद्रित" होगी और OMW [H] (विनिर्देश दस्तावेज़, 24 जुलाई 2026), वह बॉन्ड और फोस्टर के कंधों पर खड़ा था — जैसा कि उसकी दिसंबर 2025 की पाइपलाइन स्क्रिप्ट्स, जो सीधे OMW की डेटा फ़ाइलों को पार्स करती थीं, पहले से ही कर चुकी थीं।
2.4 The open-data ecosystem around the wordnets
OMW एक बड़े, खुले लाइसेंस वाले पारिस्थितिकी तंत्र में एक नोड है जिसे कोई व्यक्ति कानूनी और तकनीकी रूप से जोड़ सकता है:
- Wiktionary — विकिमीडिया द्वारा होस्ट की गई सहयोगात्मक शब्दकोश
फाउंडेशन — सैकड़ों भाषाओं में बहुत व्यापक शब्दावली कवरेज प्रदान करता है, परिभाषाएँ, अनुवाद, विभक्तियाँ और उच्चारण सहित, के अंतर्गत शेयर-अलाइक लाइसेंस (Wikimedia Foundation; देखें मेयर और गुरेविच, 2012, विशेषज्ञ-शब्दकोश प्रतिद्वंद्वी के रूप में इसके मूल्य पर)
- Wikidata — विकिमीडिया का संरचित ज्ञान आधार — कथन संग्रहीत करता है।
मशीन-पठनीय पहचानकर्ताओं के साथ और CC0 (सार्वजनिक) के तहत जारी किया गया है डोमेन) (Vrandečić & Krötzsch, 2014).
- Universal Dependencies (UD) — एक सामुदायिक परियोजना जो प्रकाशित करती है
एक सौ से अधिक में व्याकरणिक रूप से चिह्नित वाक्य ट्रीबैंक खुले लाइसेंस के तहत भाषाएँ (Nivre et al., 2020)। यूडी योगदान देता है। वास्तविक वाक्य और शब्द-प्रकार संबंधी जानकारी — इस बात का प्रमाण कि शब्द कैसे होते हैं वास्तव में इस्तेमाल किया गया
- [JMdict and KANJIDIC2](https://www.edrdg.org/jmdict/j_jmdict.html) — जापानी शब्दकोश और कांजी फ़ाइलें
जिम ब्रीन के EDRDG प्रोजेक्ट द्वारा बनाए रखा गया, जो जापानी को कवर करता है। व्यापक रूप से और कई भाषाओं में अनुवादों के साथ (Breen, 2004)। ये लेखक के शुरुआती बिंदु थे (उनकी सबसे पहली शब्दकोश फ़ाइल, (नवंबर 2025 में डाउनलोड किया गया, KANJIDIC2 [H] था)।
- UniMorph — रूप-परिवर्तन संबंधी व्याकरण (शब्द
व्याकरणिक विशेषता के अनुसार व्यवस्थित run/ran/running जैसे रूप) (Kirov et al., 2018; McCarthy et al., 2020).
- OPUS — निकाले गए समानांतर (अनुवादित) वाक्यों का एक बड़ा संग्रह
वेब और फिल्म उपशीर्षकों से, खुले लाइसेंस के तहत (Tiedemann, 2012)।
- Word frequency lists such as [wordfreq](https://github.com/rspeer/wordfreq) (Speer, 2022), which rank
वास्तविक कॉर्पस में शब्दों की सामान्यता के आधार पर।
- The ISO 639-3 standard, जो प्रत्येक मानव भाषा को एक स्थिर
तीन-अक्षर कोड (जैसे, स्पेनिश के लिए spa, जापानी के लिए jpn), बनाए रखा गया SIL International द्वारा — Lingua Mundi डेटाबेस इन कोडों का उपयोग अपनी language तालिका [H] की कुंजियों के रूप में करता है।
इस पारिस्थितिकी तंत्र के दो गुणों पर जोर देना उचित है क्योंकि वे पूरे प्रोजेक्ट की संरचना करते हैं। पहला, लाइसेंस वास्तव में खुले हैं — अनुमत या साझा-समान — इसलिए जब तक श्रेय और लाइसेंस की शर्तों का सम्मान किया जाता है, तब तक उन्हें एक व्युत्पन्न डेटाबेस में संयोजित करना कानूनी है (Lingua Mundi अपने स्वयं के source तालिका में प्रत्येक आयातित डेटासेट के स्रोत और लाइसेंस को रिकॉर्ड करता है; अनुभाग 6 देखें)। दूसरा, यह पारिस्थितिकी तंत्र complementary है: Wiktionary व्यापक लेकिन उथला है; वर्डनेट गहरे लेकिन संकीर्ण हैं; UD उपयोग के बारे में है; UniMorph शब्द रूपों के बारे में है; आवृत्ति सूचियाँ प्रमुखता के बारे में हैं। Lingua Mundi की इंजीनियरिंग समस्या "डेटा खोजना" नहीं है — यह "उन डेटा को मर्ज करना है जिन्हें कभी मर्ज करने के लिए डिज़ाइन नहीं किया गया था, बिना जोड़ों के बारे में झूठ बोले।"
2.5 Why a map of meaning still matters in the age of large models
एक उचित आपत्ति को स्पष्ट रूप से बताया जाना चाहिए: यदि बड़े भाषा मॉडल पहले से ही शब्दों का अनुवाद, परिभाषित और तर्क कर सकते हैं, तो एक संरचित शब्दकोश बिल्कुल क्यों बनाएं? Lingua Mundi लेखक का उत्तर, जिसे उनके जून 2026 के शोध पत्र (अनुभाग 3) में विकसित किया गया और गर्मियों के दौरान परिष्कृत किया गया, के तीन भाग हैं। पहला, verifiability: एक संरचित डेटाबेस अपना काम दिखा सकता है — हर लिंक का एक स्रोत, एक लाइसेंस और एक तारीख होती है — जबकि एक मॉडल का ज्ञान एक अपारदर्शी सांख्यिकीय मिश्रण है जिसे ऑडिट, सुधार या उद्धृत नहीं किया जा सकता। दूसरा, cost and access: एक स्थानीय डेटाबेस को क्वेरी करने में कुछ भी खर्च नहीं होता है और यह ऑफ़लाइन काम करता है, जबकि हर मॉडल क्वेरी में ऊर्जा, पैसा, या दोनों खर्च होते हैं; लेखक का स्थायी डिज़ाइन नियम "शून्य-टोकन अनुसंधान क्वेरीज़" है — स्थानीय API is अनुसंधान सतह [H] (परियोजना नोट, 29 अगस्त 2026)। तीसरा, complementarity: जून 2026 के पेपर ने यह तर्क दिया — एक परिकल्पना के रूप में, तीन मॉडलों के ऑडिट एक ही निष्कर्ष पर सहमत थे — कि कच्चे टोकन के बजाय कॉन्सेप्ट आईडी पर काम करने वाला एक कॉम्पैक्ट मॉडल कहीं अधिक कुशल हो सकता है, क्योंकि कॉन्सेप्ट मैप नेटवर्क के बाहर सेमांटिक कार्य करता है (अनुभाग 3 देखें)। चाहे वह परिकल्पना प्रयोगों में सफल हो या न हो, मानचित्र स्वयं मॉडलों के लिए उपयोगी बना रहता है: एक बाहरी मेमोरी के रूप में जिसे बिना पुनः प्रशिक्षण के पूछा, अपडेट किया और उद्धृत किया जा सकता है।
Lingua Mundi की बौद्धिक वंशावली को इस प्रकार एक में सारांशित किया जा सकता है एक पंक्ति में: यह इंटरलिंगुआ का सपना है, जिसे WordNet ने शब्दावली तक सीमित किया, OMW ने बहुभाषी बनाया, ओपन-डेटा आंदोलन ने कानूनी बनाया, और एक अनुवादक की ऐसी शब्दकोश की ज़रूरत ने इसे व्यक्तिगत बना दिया जो भाषा को नहीं, बल्कि अर्थ को दर्ज की जाने वाली चीज़ के रूप में माने।
3 · The name, the thesis, and the seven-graph architecture (May–June 2026)
3.1 Naming
मई 2026 के अंत तक लेखक के नोट्स और विनिर्देशों में कार्यशील शीर्षक "बहुभाषी शब्दावलोकन मंच" [H] का उपयोग किया गया था (मार्कडाउन विनिर्देश मास्टर दिनांक 23 मई 2026, /home/rex/Descargas/Phone backup/Download/)। नाम लिंगुआ मुंडी — लैटिन में "विश्व की भाषा" — पहली बार 1 June 2026 पर उपलब्ध रिकॉर्ड में, एक शोध पांडुलिपि (नीचे देखें) के शीर्षक के रूप में दिखाई देती है [H] (संवाद लॉग, 1 जून 2026; लेखक के अभिलेखागार में सबसे पुरानी सत्यापित घटना)। यह नाम उपयुक्त है: परियोजना का दावा यह नहीं है कि इसमें कई भाषाएँ हैं, बल्कि यह कि वे भाषाएँ about the one space of meaning साझा करती हैं।
3.2 A research thesis: meaning, not tokens
लगभग मार्च और जून 2026 के बीच लेखक ने — ChatGPT, Claude, और DeepSeek के साथ बातचीत में — एक शोध प्रबंध विकसित किया कि भाषा का एक अवधारणा-स्तर का मानचित्र भाषा प्रौद्योगिकी को मौलिक रूप से अधिक कुशल और सुलभ क्यों बना सकता है। यह थीसिस, उस कार्यशील रूपरेखा में है जिसे लेखक ने बातचीत में लाया (18 जुलाई 2026 के अपने व्यवहार्यता अनुरोध से शब्दशः उद्धृत, जहाँ उन्होंने समीक्षा के लिए विवरण पेस्ट किया था) [H]:
"Create a multilingual, open, machine-readable map of human language that separates: 1. Meaning · 2. Form · 3. Structure · 4. History · 5. Usage — into interoperable graphs. The long-term objective is to make language computable at the concept level rather than the token level. […] Modern NLP largely models: token → token. Lingua Mundi models: concept ↔ language."
जून पांडुलिपि में व्यक्त किया गया मूल तर्क यह है कि एक भाषा मॉडल अपनी अधिकांश क्षमता surface variation पर खर्च करता है — "कुत्ता", का व्यवहार करते हुए, "perro", और "犬" को तीन असंबंधित चीज़ों के रूप में देखता है, जबकि वे वास्तव में [H] (पांडुलिपि V4, 1 जून 2026 के ऑडिट वार्तालाप में पूरी तरह उद्धृत) में एक ही चीज़ के तीन रूप हैं। यदि कोई मॉडल इसके बजाय concept sequences पढ़ और लिख सकता है — जिसमें कॉन्सेप्ट मैप नेटवर्क के बाहर बहुभाषी कार्य करता है — तो मॉडल छोटा, सस्ता हो सकता है, और साधारण कंप्यूटरों पर चलाया जा सकता है।
3.3 Seven versions in one morning: the adversarial-collaboration method
Lingua Mundi: कॉन्सेप्ट-ग्राउंडेड लैंग्वेज मॉडल्स के लिए एक सेमंटिक इंफ्रास्ट्रक्चर शीर्षक वाले पांडुलिपि ने एक seven-layer आर्किटेक्चर का प्रस्ताव दिया: एक कॉन्सेप्ट ग्राफ (भाषा-स्वतंत्र अर्थ, लक्षित आकार एक अरब नोड्स), एक सिन्सेट ग्राफ़ (हर भाषा के शब्दों को अवधारणाओं पर मैप करना), और रूप-विज्ञान, व्युत्पत्ति, शब्द-मूल, अंतर-भाषा संबंध, और उपयोग के लिए ग्राफ़ — सभी एक सामान्य पहचानकर्ता प्रणाली द्वारा जुड़े हुए; साथ ही एक अवधारणा-आधारित मॉडल वास्तुकला (एक माम्बा-शैली का अनुक्रम मॉडल पढ़ना अवधारणा पहचानकर्ताओं), अवधारणा ग्राफ़ के लिए हाइपरबॉलिक (पॉइंकेरे-बॉल) एम्बेडिंग, तथ्यों की स्पष्ट ग्राफ़-पुनर्प्राप्ति, और एक ऑडिट किया गया बजट जो दिखाता है कि पूरी चीज़ साधारण लैपटॉप पर [H] (पांडुलिपि, 1 जून 2026) फिट हो जाती है।
इस एपिसोड को method के रूप में उल्लेखनीय — और असामान्य रूप से अच्छी तरह से प्रलेखित — जो बनाता है, वह यह है कि लेखक ने पांडुलिपि अकेले नहीं लिखी। 1 June 2026 की सुबह उन्होंने मसौदे को सात लगातार संशोधनों से गुज़ारा (V1–V7) आधे घंटे से भी कम समय में, दो मॉडलों का प्रतिद्वंद्वी रूप से उपयोग करते हुए: DeepSeek ने प्रत्येक संशोधन का मसौदा तैयार किया जबकि ChatGPT ने प्रत्येक मसौदे का एक शत्रुतापूर्ण सहकर्मी समीक्षक [H] (संवाद लॉग, DeepSeek की गंभीरता के साथ ऑडिट किया। "Revisión y corrección del proyecto Lingua Mundi" और ChatGPT "Audit Feedback Lingua Mundi", दोनों 1 जून 2026)। ऑडिट ट्रांसक्रिप्ट को शब्दशः संरक्षित किया गया है और वे इस बारे में असामान्य रूप से स्पष्टवादी हैं कि प्रत्येक दौर में क्या ठीक किया गया:
- INT8 एम्बेडिंग स्टोरेज की अंकगणित को ठीक किया गया (एक गुणांक से चूक-
भंडारण बजट में दो-की त्रुटि);
- एक मनगढ़ंत अनुभवजन्य दावा ("अनुभवजन्य रूप से, हम पाते हैं…") हटा दिया गया और
पहले के काम पर आधारित एक स्पष्ट रूप से लेबल किए गए परिकल्पना से प्रतिस्थापित;
- एक काल्पनिक भविष्य के मॉडल के विरुद्ध तुलना को एक के साथ बदल दिया गया था
एक वास्तविक के खिलाफ तुलना (DeepSeek-V3);
- सार के प्रदर्शन संबंधी दावों को क्रमशः संकीर्ण किया गया;
- असमर्थित स्केलिंग दावों को पुनः लेबल करके खुली अनुसंधान समस्याओं के रूप में चिह्नित किया गया; और
- पांडुलिपि को V7 द्वारा एक अनुभवजन्य दावे से एक ईमानदार में पुनः रूप दिया गया।
स्थिति पत्र — एक शोध कार्यसूची जिसमें स्पष्ट रूप से खंडनीय मूल्यांकन हो। योजना (शब्द-अर्थ-विवेचन मजबूती, अपक्षय, आधाररेखाएँ)।
ऑडिटों के अंतिम फैसले, जो लॉग्स में संरक्षित हैं, ने पांडुलिपि के vision को बहुत उच्च माना जबकि लगातार empirical support को निम्न माना — और अंतिम ऑडिट की समापन सिफारिश सीधी थी [H]:
"If I were advising the project, I would now pivot from paper-writing to implementation. The next valuable artifact is not V8. It is Lingua Mundi Prototype 0.1 … with: 100k–1M concepts, English only, concept tokenizer, concept reconstruction, TinyStories training run, direct comparison against token-Mamba. That experiment would answer the central question: does semantic compression preserve enough information to justify the bottleneck?"
लेखक ने उस सलाह का पालन किया। इस प्रकरण के बारे में तीन अवलोकन आगे हुई सभी घटनाओं को समझने के लिए महत्वपूर्ण हैं। पहला, idea कभी भी बाधा नहीं था — लेखक के अपने शब्दों में, उनकी दृष्टि को ऑडिट ने A− रेटिंग दी थी; बाधा सबूत था, और ऑडिट ने यह बात सात बार कही। दूसरा, लेखक की कार्यप्रणाली — कई एआई मॉडलों को प्रतिद्वंद्वी सहयोगी के रूप में उपयोग करना, हर मसौदे और हर ऑडिट को रखना, और ईमानदार अति आत्मविश्वासपूर्ण अतिशयोक्ति — स्टूडियो का स्थायी मानक बन गया, और यही तरीका वर्तमान पेपर (परिशिष्ट A) के [H]/[O]/[NV] सत्यापन सम्मेलनों में दिखाई देता है। तीसरा, उस जून की पांडुलिपि की सात-परत वाली संरचना गायब नहीं हुई जब लेखक ने कार्यान्वयन की ओर रुख किया: यह परियोजना का roadmap बन गया। आज (सितंबर 2026) मौजूद Lingua Mundi कॉन्सेप्ट ग्राफ़, सिन्सेट ग्राफ़, मॉर्फोलॉजी इम्पोर्ट, कॉर्पस लेयर्स और एक API को लागू करता है; व्युत्पत्ति, व्युत्पत्ति-विज्ञान, पत्राचार, और उपयोग परतें उसी योजना (अनुभाग 5–6, 10.3) [H] (परियोजना रोडमैप, 29 अगस्त 2026) के स्पष्ट रूप से कतारबद्ध चरण हैं।
4 · The platform takes shape (July–August 2026)
4.1 Feasibility: "can this be done with open-source components?"
18 July 2026 पर लेखक ने ChatGPT से सीधे पूछा कि क्या इस दृष्टिकोण को मौजूदा मुफ्त घटकों से बनाया जा सकता है और इसे विकसित करने के लिए उसे क्या चाहिए होगा [H] (संवाद "Lingua Mundi परियोजना व्यवहार्यता", 2026-07-18, 00:44 UTC — लेखक के सेंट्रल टाइम ज़ोन में 17 जुलाई की शाम)। यह बातचीत — और इसके बाद के सप्ताह — शोध पत्र से इंजीनियरिंग कार्यक्रम की ओर हुए बदलाव को दर्ज करते हैं। परियोजना ने उस बातचीत में समीक्षा के लिए चिपकाए गए औपचारिक मिशन वक्तव्य को अपनाया (धारा 3.2 में उद्धृत), और लेखक ने वास्तविक कोड की रूपरेखा तैयार करना शुरू कर दिया: डेटा मॉडल के लिए स्कीमा फाइलें डिस्क पर दिनांकित मौजूद हैं 17 जुलाई 2026 [H] (कोड स्नैपशॉट, जुलाई 2026; देखें परिशिष्ट A)।
4.2 The engineering specification (24 July 2026)
24 July 2026 पर लेखक ने डिज़ाइन को 104-पृष्ठ की एक इंजीनियरिंग विनिर्देश, मल्टीलिंगुअल लेक्सिकल प्लेटफ़ॉर्म — इंजीनियरिंग स्पेसिफिकेशन, संस्करण 2.0, में समेकित किया, जिसका उपशीर्षक "संशोधित और उत्पादन-तैयार" है। [H] (पीडीएफ, /home/rex/, 24 जुलाई 2026; इस पेपर के लिए निकाला गया पाठ)। यह विनिर्देशन परियोजना का संविधान है, और इसकी सामग्री यह समझाती है कि बाद में क्या-क्या बनाया गया:
- The synset-centric principle. दस्तावेज़ में कहा गया है कि प्रत्येक शब्दात्मक
वस्तु को अंततः एक synset (एक अर्थ) से जुड़ना चाहिए, और कि वह डेटाबेस वर्तनी के बजाय अर्थों के आधार पर व्यवस्थित है। यह काम कर गया। उदाहरण के लिए शब्द bank है, जो कई सतहों वाला एक ही सतह रूप होना चाहिए। विशिष्ट सिनसेट ("नदी का किनारा", "वित्तीय संस्थान", "भरोसा करना") कुछ") — कभी भी एकरूप, अव्यवस्थित अर्थों का एक गुच्छा नहीं [H]।
- Language tiers. विनिर्देश ने भाषाओं को दो स्तरों में योजनाबद्ध किया:
लॉन्च के लिए टियर 1 — अंग्रेज़ी, स्पेनिश, फ्रेंच, पुर्तगाली, जापानी, और मैंडारिन चीनी (सरलीकृत और पारंपरिक) — और टियर 2 — इतालवी, कोरियाई और वियतनामी [H]। (वास्तव में जो सेट भेजा गया था उसमें डेटाबेस दो दिलचस्प तरीकों से भिन्न है, जो अनुभाग 10 में प्रलेखित हैं: the लाइव छह हैं: अंग्रेज़ी, स्पेनिश, फ्रेंच, जर्मन, पुर्तगाली, जापानी — मैंडारिन और इतालवी अनुपस्थित हैं, जर्मन मौजूद है। प्रतिस्थापन है बचे हुए अभिलेख [NV] में कहीं भी स्पष्ट रूप से नहीं बताया गया, एक ईमानदार स्वीकारोक्ति एक अनसुलझा उत्पत्ति प्रश्न।
- The data model. विनिर्देश का अध्याय 5 स्कीमा का रूपरेखा प्रस्तुत करता है।
व्यापक रूप से, और वह मॉडल जो रिपॉजिटरी के पहले माइग्रेशन में भेजा गया था एक ग्यारह-टेबल का कोर जो से मेल खाता है दिसंबर 2025 प्रोटोटाइप की चार-इकाई अंतर्दृष्टि, अब औपचारिक रूप से स्थापित: भाषाएँ, लेक्सिम, अर्थ, अवधारणाएँ (सिनसेट), संबंध, स्रोत सिनसेट्स, और सहायक तालिकाएँ (देखें अनुभाग 5)।
- A five-level alignment hierarchy. क्योंकि स्वचालित और मैनुअल लिंक करना
शब्दों से अवधारणाओं तक की विश्वसनीयता भिन्न होती है, प्रस्तावित विनिर्देश स्पष्ट स्रोत-निर्दिष्ट लिंकों से संरेखण विश्वास के पाँच स्तर (जैसे, OMW मैपिंग्स) से लेकर अनुमानित अनुमानों तक — इस नियम के साथ कि प्रत्येक संग्रहीत लिंक अपने विश्वास स्तर को साथ लेकर चलता है। यह की परिपक्व रूप है। दिसंबर 2025 "शून्य ह्यूरिस्टिक्स" नियम: no स्वचालित लिंक नहीं, बल्कि labeled, honest [H] से जुड़ रहा है।
- A phase roadmap with gates. चरण 0–5, प्रत्येक के साथ एक निकास मानदंड,
स्कीमा और ETL से API तक और अनुप्रयोगों तक।
- A risk register — जिसमें व्युत्पत्ति प्रस्तावित करने वाला आत्म-आलोचना परिशिष्ट शामिल है
और CJKV/युनीहान परतें और जापानी–चीनी "गलत मित्रों" के बारे में चेतावनी (जैसे, जापानी में 娘 "बेटी" बनाम चीनी में "माँ"; 手紙 "पत्र" बनाम "टॉयलेट पेपर") [H].
स्पेसिफिकेशन ने उस स्टैक को भी तय किया जिसे प्रोजेक्ट बाद में सरल बनाएगा: FastAPI, PostgreSQL, एक सर्च इंजन (स्पेसिफिकेशन में Meilisearch), और एक वेब फ्रंटएंड (Next.js)। विशेष रूप से, 13 अगस्त तक लेखक स्वयं ही उस स्टैक पर सवाल उठा रहे थे (अनुभाग 4.4)।
4.3 The July journal: thinking about the semantic operating system
लगभग उन्हीं दिनों, लेखक के निजी जर्नल (knowledge project.txt, 85 KB, इस पेपर के लिए पूरा पढ़ें; फ़ाइल टाइमस्टैम्प 18 जुलाई 2026, एक ही कार्य सत्र) में एक संबंधित और अधिक व्यक्तिगत विषय-सूत्र दर्ज है: एक "सार्वभौमिक सेमांटिक ग्राफ़" — अर्थ को दर्शाने का एक संकेतन-स्वतंत्र तरीका जो प्रोग्रामिंग भाषाओं, संगीत सिद्धांत, रसायन विज्ञान और प्राकृतिक भाषा (एक अलग परियोजना जिसे उन्होंने USG नाम दिया था) में काम करेगा। [H] (जर्नल, जुलाई 2026)। जर्नल का सबसे लिंगुआ-मुंडी-प्रासंगिक अंश (पंक्तियाँ 2563– 2587) यह प्रतिबिंब है कि one semantic object को एक साथ तीन भाषाओं में अनुवादित करने का क्या अर्थ होगा — यह cat · gato · 猫 जैसा ही अंतर्ज्ञान है, जो भाषाओं के बजाय इंटरफेस के बारे में सोचने के अभ्यास के रूप में लिखा गया था [H]. यह ध्यान देने योग्य है कि जर्नल का स्वयं का एक "भाषा" का कामकाजी उदाहरण जो होना था समझाया जाना है, वह Lingua Mundi कोडबेस का LanguageCreate स्कीमा है — यह इस बात का प्रमाण है कि जुलाई के मध्य तक दोनों धागे (अनुसंधान दृष्टि और वास्तविक कोड) पहले से ही उसके मन में एक साथ बुन चुके थे [H]।
4.4 August: from schema to running system
अगस्त 2026 वह समय था जब Lingua Mundi, system बन गया। बचे हुए लॉग्स निर्णयों की एक घनी श्रृंखला दिखाते हैं, जिनमें से प्रत्येक अपना निशान छोड़ता है:
- 1–8 August. लेखक ने ग्राफ़ और ज्ञान-प्रतिनिधित्व का अन्वेषण किया।
विकल्प ("JSON एक ग्राफ़ के रूप में", 29 जुलाई; API मुद्रीकरण के विचार, 7–12 अगस्त) और — अंतिम वास्तुकला के लिए महत्वपूर्ण रूप से — यह पूछा कि क्या API वास्तव में एक भारी स्टैक (अनुभाग 4.5) [H] की आवश्यकता है।
- 11 August. ने Maya languages को लिंगुआ में एकीकृत करने का अन्वेषण किया।
मुंडी ("Lingua Mundi माया इंटीग्रेशन"), में रुचि जारी रखते हुए दिसंबर 2025 के संदेश [H] में पहली बार सुनाई गई स्वदेशी मैक्सिकन भाषाएँ।
- 13 August. दो डिज़ाइन वार्तालापों ने आकार को तय किया।
उत्पाद: "लिंग्विस्टिक API टेक स्टैक" (देखें 4.5) और "सेमांटिक इंटरैक्शन" "लेयर", जिसने ज्ञान परत के बीच भविष्य के इंटरफ़ेस की रूपरेखा तैयार की और अनुप्रयोग [H]।
- 19–25 August. उसने Japanese demonstration का निर्माण किया: एक कॉम्पैक्ट
ऑफ़लाइन डेटाबेस (SQLite) में जापानी शब्दकोश डेटा को बंडल करना ताकि अवधारणा-उन्मुख डिज़ाइन को छुआ जा सकता था, पूछताछ की जा सकती थी, और दूसरों को दिखाया जा सकता था। ("जापानी डेमो बनाएं"; उत्पन्न lingua-mundi-jpn.sqlite फ़ाइलें हैं डिस्क पर संरक्षित) [H]। स्प्रिंट की एक ठोस समयसीमा थी और दर्शक: Japan Foundation के प्रतिनिधि उसके पास आना थे। विश्वविद्यालय अगले सप्ताह, और डेमो (फुरिगाना के साथ (उसी अवधि में जिसका नाम बदलकर Shikibu रखा जा रहा था) के रूप में तैयार किया गया था उस मुलाकात [H] के लिए एक पीछे-छोड़ने वाला उत्पाद दस्तावेज़ (संवाद लॉग, 19–25 अगस्त 2026).
- 23 August. ने अवधारणा का एक-अनुच्छेद विवरण मांगा, उसने
एक सारांश वापस मिला जो लॉग में दिख रही उसकी बिल्डिंग से मेल खाता है: "एक मानव भाषाओं के लिए मशीन-पठनीय भाषाई अवसंरचना… बल्कि केवल एक जापानी शब्दकोश या अनुवाद ऐप होने से कहीं बढ़कर, Lingua Mundi है "एक सामान्य भाषाई बुद्धिमत्ता परत बनने के लिए अभिप्रेत" [H] — और, उसी बातचीत में, एक technical विवरण नामकरण कर रहा था तब-योजित स्टैक (PostgreSQL, ग्राफ़ क्वेरीज़ के लिए Apache AGE, OpenSearch पुनर्प्राप्ति के लिए, FastAPI को API के रूप में कि अगले महीने के माप बेकार कर देगा (धारा 4.5, धारा 6) [H]।
- 24 August onward. कोडबेस अपने स्थायी घर में एक के रूप में स्थानांतरित हो गया।
दैनिक GitHub-बैकअप स्नैपशॉट के साथ उचित रिपॉजिटरी ("LinguaMundi") 27 अगस्त से शुरू होने वाला ट्रेल [H] (रिपॉजिटरी स्नैपशॉट्स; परिशिष्ट A देखें)।
4.5 The lean-stack decision that shaped everything
अगस्त का सबसे महत्वपूर्ण तकनीकी निर्णय शब्दशः संरक्षित है। 13 August 2026 पर लेखक ने अपना नियोजित टेक्नोलॉजी स्टैक पेस्ट किया — FastAPI, Polars, DuckDB, PostgreSQL, Apache AGE (एक ग्राफ एक्सटेंशन), OpenSearch, Redis, Celery, React, और Docker — और पूछा: "क्या भाषाई API को वास्तव में इस स्टैक की आवश्यकता है यदि यह पहले से ही पोस्टग्रेएस पर चल रहा है?" [H] (संवाद "लिंग्विस्टिक API टेक स्टैक", 13 अगस्त 2026)।
उसे जो जवाब मिला — और उसने अपनाया — वह यह था कि अभी इसका लगभग कोई भी हिस्सा ज़रूरी नहीं था: PostgreSQL अकेले ही रिलेशनल डिक्शनरी डेटा, कांजी, रीडिंग्स, संयुग्म, अनुवाद, फुल-टेक्स्ट सर्च, और यहां तक कि ग्राफ-स्टाइल भी प्रदान कर सकता था पुनरावर्तक क्वेरीज़, और सही नियम था "PostgreSQL सीमा → तकनीक जोड़ें," न कि "चरण 3 कहता है ग्राफ़ डेटाबेस → ग्राफ़ डेटाबेस स्थापित करें" [H] (वही बातचीत)। सलाह का निष्कर्ष था: "आपके API का प्रतिस्पर्धात्मक लाभ इन्फ्रास्ट्रक्चर नहीं है। यह उस भाषाई डेटा मॉडल और परिवर्तनों का है जो आपने डेटा के ऊपर बनाया है" [H]।
यह निर्णय — एक रिलेशनल डेटाबेस, एक API फ्रेमवर्क, और मापी गई आवश्यकता तक कुछ नहीं — अनुभाग 6–7 में वर्णित प्रदर्शन वास्तुकला का प्रत्यक्ष पूर्वज है। जब, सितंबर 2026 में, डेटाबेस 1.6 मिलियन वर्ड सेंस तक बढ़ गया और सरल क्वेरीज़ मिनटों तक धीमी हो गईं, तो लेखक ने ग्राफ़ डेटाबेस या सर्च इंजन का सहारा नहीं लिया: उन्होंने PostgreSQL materialized views — "बेक, दोबारा व्युत्पन्न न करें" पैटर्न — का सहारा लिया और 2014 के हार्डवेयर पर सबसे धीमी क्वेरी को एक मिनट से घटाकर लगभग एक सेकंड कर दिया (अनुभाग 7)। पतले बने रहने का अगस्त का निर्णय ही था जिसने उस सितंबर के अनुकूलन को आवश्यक और संभव दोनों बनाया।
4.6 The human-AI development method, in practice
इस इतिहास के किसी भी पाठक ने ध्यान दिया होगा कि लगभग हर मील के पत्थर के साथ एक वार्तालाप लॉग जुड़ा हुआ है: लेखक संवाद के माध्यम से सोचता है। अगस्त 2026 तक उसकी पद्धति एक ऐसी चीज़ में स्थिर हो गई थी जिसे रिकॉर्ड से सटीक रूप से वर्णित किया जा सकता है:
- The human sets the direction and owns the data. हर अनुरोध में
लॉग्स लेखक के अपने हैं; हर फ़ाइल उसकी मशीन पर है; हर निर्णय — जिसमें लीन-स्टैक प्रश्न जैसी उलटफेरें भी शामिल हैं — यह उसका है।
- AI models are used as specialized collaborators. ChatGPT का उपयोग किया गया था।
शोध, वास्तुकला समीक्षा और ऑडिट के लिए भारी रूप से; DeepSeek के लिए ड्राफ्टिंग और संशोधन चक्र और (बाद में) अंतर्निहित हार्नेस के रूप में स्टूडियो की अपनी ऑटोमेशन; दीर्घकालिक स्मृति और परियोजना के लिए क्लॉड प्रसंग (स्टूडियो का ज्ञान आधार क्लॉड मेमोरी एक्सपोर्ट के रूप में शुरू हुआ)।
- The record is kept. वार्तालाप निर्यात किए जाते हैं (लेखक के अभिलेखागार)
(हजारों शामिल हैं), कोड का स्नैपशॉट लिया जाता है, और — 26 अगस्त 2026 से — हर कार्य सत्र Obsidian ज्ञान आधार में लॉग इन किया जाता है। प्रस्तावना, तिथियाँ, और सत्यापन स्थिति (अनुभाग 9)। यह पेपर है यह केवल उस रिकॉर्ड रखने की आदत के कारण ही संभव था।
- Adversarial review is built in. जून पांडुलिपि का V1–V7 ऑडिट
लूप (अनुभाग 3.3) एक स्थायी प्रथा बन गया: मसौदों का ऑडिट एक द्वारा किया जाता है। उन्हें लिखने वाले से अलग मॉडल, और ऑडिट चालू रखे जाते हैं। फ़ाइल।
चाहे कोई इसे "वाइब कोडिंग," "एआई-सहायित विकास," या बस "टूल का उपयोग करना" कहे, रिकॉर्ड के लिए ईमानदार लेबल मायने रखता है: Lingua Mundi एक मानवीय-रचित परियोजना है जिसे AI सहायकों के साथ जानबूझकर, प्रलेखित सहयोग में बनाया गया है, और यह पेपर (जो लेखक के निर्देशन में, अग्रिम-पाठ सूचना के अनुसार स्वयं एक AI-जनित मसौदा है) उसी विधि का एक उत्पाद है।
5 · Design: the linguistic and mathematical principles of the model
यह अनुभाग सरल भाषा में उन विचारों की व्याख्या करता है जो यह निर्धारित करते हैं कि लिंगुआ मुंडी भाषा को कैसे संग्रहीत करती है। जो पाठक history चाहते हैं, वे अनुभाग 6 पर जा सकते हैं; जो पाठक formulas and schema चाहते हैं, वे उन्हें यहाँ और परिशिष्ट A में पाएँगे।
5.1 Four kinds of objects, one space of meanings
डेटा मॉडल सीधे दिसंबर 2025 पाइपलाइन के चार एंटिटी प्रकारों (अनुभाग 1.2) और जुलाई 2026 विनिर्देश के ग्यारह टेबलों [H] से लिया गया है। अपने परिपक्व रूप में यह पाँच मुख्य प्रकार की चीज़ों को संग्रहीत करता है (लाइव स्कीमा, सितंबर 2026 [H] के विरुद्ध सत्यापित):
- Language — प्रत्येक मानव भाषा के लिए एक पंक्ति, इसकी ISO 639-3 द्वारा कुंजीबद्ध।
तीन-अक्षर का कोड (eng, spa, jpn, …), अपने नाम के साथ, स्वनाम (the नाम (वक्ता जो उपयोग करते हैं), भाषा परिवार, और लिपि। एक जोड़ना पूरे सिस्टम के लिए भाषा, डिज़ाइन के अनुसार, एक पंक्ति और डेटासेट जोड़ रही है: कहीं भी प्रति-भाषा तालिकाएँ नहीं हैं [H] (कोड और प्रोजेक्ट नोट, 29 अगस्त 2026)। यह "भाषा-तटस्थ" गुण स्कीमा-स्तर का है। इंटरलिंगुआ विचार की अभिव्यक्ति (अनुभाग 2.1).
- Lexeme — एक विशिष्ट भाषा में एक शब्द रूप: स्ट्रिंग
cat,
string gato, string 猫। एक लेक्सिम ठीक एक ही भाषा से संबंधित होता है। और वाक्य में एक भाग होता है।
- Sense — one meaning of one lexeme as recorded by one dictionary:
WordNet से 'बिल्ली' (जानवर के अर्थ में), से 'बिल्ली' (जैज़ संगीतकार के अर्थ में) WordNet, Wiktionary से yule-log अर्थ वाला "cat"। एक लेक्सिम आमतौर पर होता है कई अर्थ — इस प्रकार मॉडल polysemy (एक शब्द, कई अर्थ) बिना कभी अर्थों को एक साथ मिलाए। एक भावना हो सकती है या शायद अभी किसी अवधारणा से जुड़ा नहीं है; लिंक क्षेत्र concept_id है। और यह nullable by design है — एक अनलिंक्ड सेंस को रखा जाता है और दिखाया जाता है अनुमान से जोड़े जाने के बजाय एक अनाथ [H] (स्कीमा; पाइपलाइन नोट्स, दिसंबर २०२५
- Concept — एक अर्थ, जो भाषाओं में साझा है: अवधारणा
Princeton WordNet सिन्सेट URI द्वारा पहचानी गई "घरेलू बिल्ली" princeton-wordnet:02121620-n [H] (लाइव डेटाबेस)। अवधारणाएँ कहाँ हैं बहुभाषी संरेखण होता है: स्पेनिश gato (इसके एक अर्थ), अंग्रेज़ी cat, फ्रेंच chat, जर्मन Katze, और जापानी 猫 सभी कर सकते हैं एक ही अवधारणा की ओर इशारा करते हैं — वे कई नामों से जाने जाने वाले "एक सितारे" हैं। (धारा 8). अवधारणा तालिका प्रणाली का हृदय है और, वर्तमान डेटाबेस में 96,434 पंक्तियाँ हैं [H] (माप, 6–7 सितंबर) २०२६).
- Relation — दो अवधारणाओं के बीच एक टाइप किया हुआ, निर्देशित संबंध,
उदाहरण के लिए, घरेलू बिल्ली IS_A फेलिन, या फेलिन IS_A मांसाहारी। संबंध एक पूर्वधारणा, एक विश्वास और एक स्रोत धारण करता है। वर्तमान डेटाबेस में रखता है उनमें से 171,672 [H] (माप, 6–7 सितंबर 2026)
इन पाँचों के आसपास उत्पत्ति मशीनरी स्थित है — एक source तालिका जो यह रिकॉर्ड करती है कि प्रत्येक डेटासेट कहाँ से आया है, उसका लाइसेंस, और उसका URL (ताकि डेटाबेस में कोई भी दावा कभी बिना श्रेय के न रहे), OMW प्रारूप से जुड़ने वाली synset तालिकाएँ, और कांजी और रीडिंग्स [H] के लिए सहायक तालिकाएँ। (स्कीमा, सितंबर 2026)।
5.2 The alignment problem, and why it is not faked
The central intellectual problem of a multilingual map of meaning is alignment: deciding that this sense of this word in this language is the same meaning as that sense of that word in that language. Lingua Mundi's answer, inherited from the OMW design, is to not decide it fresh: the OMW already states, per language, which of its synsets correspond to Princeton WordNet synsets, so the database imports those explicit mappings as its primary alignment layer [H] (Bond & Foster, 2013; import code). Where no explicit mapping exists, the system applies its five-level confidence hierarchy (from the July 2026 specification): explicit source-stated links rank highest; inferred links rank lowest and are stored with their level — never silently promoted to "fact" [H] (specification, 24 July 2026). This is the mature form of the December rule the author scribbled in his pipeline code: "zero heuristics." It is not that the system never guesses; it is that guesses are labeled as guesses, which is what makes the database honest enough to grow: a wrong guess that is marked as a guess can be found and fixed; a wrong guess stored as fact poisons everything downstream.
भाषाओं की सूक्ष्मता को भी यही दर्शन नियंत्रित करता है। ISO 639-3 वास्तविक भाषाओं को अलग करता है, न कि राजनीतिक सीमाओं या लिपि-प्रणाली के रूपों को। लेखक ने भविष्य के लिए एक वास्तव में कठिन मामले को चिह्नित किया है: कोरियाई, जिसका एकल ISO कोड kor कोरिया गणराज्य और लोकतांत्रिक जनवादी गणराज्य कोरिया दोनों के मानक को कवर करता है। बचे हुए रिकॉर्ड इसे एक खुले मॉडलिंग निर्णय [H] के रूप में चिह्नित करते हैं। (सत्र लॉग, 7 सितंबर 2026) — यह उस योजना के सिद्धांत का एक उदाहरण है कि यह languages को संग्रहीत करता है, न कि स्थानीय क्षेत्रों को, और यह एक अनुस्मारक है कि वास्तविक दुनिया का भाषा डेटा, प्रति-भाषा एक-पंक्ति वाले साफ़-सुथरे बक्सों में फिट होने का विरोध करता है।
5.3 The graph: taxonomies, neighborhoods, and the long tail
एक बार जब इंद्रियाँ अवधारणाओं के साथ संरेखित हो जाती हैं और संबंध अवधारणाओं को जोड़ते हैं, तो डेटाबेस is एक ग्राफ़ बन जाता है: 96,434 अर्थ-नोड्स जो 171,672 प्रकारित धारों द्वारा जुड़े होते हैं, जिसमें सबसे बड़ा घटक is-a वर्गीकरण है जो WordNet से विरासत में मिला है। (स्तनधारी → मांसाहारी → बिल्ली → पालतू बिल्ली), instance-of, part-of, और cross-language संबंध [H] (माप, सितंबर 2026; स्कीमा) द्वारा समृद्ध। ऐसे ग्राफ़ के बारे में तीन गणितीय तथ्य उपयोगकर्ता इंटरफ़ेस और इंजीनियरिंग को आकार देते हैं:
- Taxonomies are trees of meaning. क्योंकि प्रत्येक अवधारणा के माता-पिता हैं
ज्ञात, सिस्टम "यह किस प्रकार का है?" (चढ़ना) का उत्तर दे सकता है और "इनकी किस्में क्या हैं?" (नीचे उतरना) — इसके पीछे के संचालन इंटरफ़ेस का वर्गीकरण लेंस (अनुभाग 8).
- Degree distributions are Zipfian. वास्तविक भाषा के ग्राफ़ हैं
scale-free-ish: कुछ अवधारणाएँ (जैसे "जानवर", "व्यक्ति", "वस्तु") के पास हैं विशाल पड़ोस, जबकि अधिकांश अवधारणाओं के पास कुछ ही पड़ोसी होते हैं। यह "लॉन्ग टेल" वही सांख्यिकीय आकार है जिसे Zipf ने प्रसिद्ध रूप से मापा था। शब्द आवृत्तियाँ (Zipf, 1949): कुछ ही शब्दों का अधिकांश हिस्सा होता है उपयोग। दो डिज़ाइन परिणाम निकलते हैं: रैंकिंग का अस्तित्व होना चाहिए (आप नहीं कर सकते एक क्वेरी के 30,000 अर्थ दिखाएँ), और रैंकिंग meaningful होनी चाहिए — इसलिए इंटरफ़ेस अवधारणाओं को उनके sky brightness के अनुसार रैंक करता है, एक किसी अर्थ की 'महत्वपूर्णता' या अच्छी-कनेक्टिविटी का एक संकेतक (खंड 5.5)।
- Shortest paths are the natural translation route. दो अवधारणाओं को देखते हुए,
ग्राफ़ में एक जोड़ने वाले पथ की खोज की जा सकती है — इसके पीछे का ऑपरेशन इंटरफ़ेस का सेक्स्टेंट टूल (अनुभाग 8.4), एक सीमित के रूप में लागू किया गया टैक्सोनॉमी पर द्विदिश ब्रेथ-फर्स्ट सर्च (≤ 10 होप्स, प्रति नोड 25 पड़ोसी, मिलीसेकंड में उत्तर देते हैं) [H] (कोड, लाइव माप, सितंबर 2026)।
5.4 Zipf and the shape of dictionaries
Zipf के नियम का एक स्पष्ट उल्लेख किया जाना चाहिए क्योंकि यह चुपचाप पूरे प्रदर्शन वास्तुकला (performance architecture) को समझाता है। यदि शब्दों की आवृत्ति एक पावर लॉ (power law) का अनुसरण करती है, तो किसी भी शब्दकोश में आम शब्दों का एक छोटा हिस्सा और दुर्लभ शब्दों की एक बहुत लंबी सूची (astronomically long tail) हावी रहती है। जून 2026 की पांडुलिपि ने तो अवधारणा शब्दावलियों [H] के लिए एक Zipf-आधारित कवरेज गणना भी व्युत्पन्न की (पांडुलिपि V7 ऑडिट, 1 जून 2026)। डेटाबेस के लिए, लॉन्ग टेल का मतलब है: ज़्यादातर rows दुर्लभ शब्द होते हैं, ज़्यादातर queries सामान्य शब्द होते हैं, और कोई भी क्वेरी जिसे पूरी टेबल — सभी दुर्लभ शब्दों सहित — को स्कैन करना पड़ता है, वह एक ऐसी क्वेरी से आपदाजनक रूप से धीमी होती है जो पहले से गणना किए गए रैंकिंग से शुरू हो सकती है। अनुभाग 7 का मैटेरियलाइज़्ड-व्यू पैटर्न, मूल रूप से, Zipf के नियम को प्रदर्शन के दुश्मन से एक डिज़ाइन टूल में बदलने का एक तरीका है: बेक करें head (रैंकिंग, प्रति अवधारणा शीर्ष शब्द) एक बार तैयार करें, और tail को उन दुर्लभ लुकअप के लिए रिलेशनल टेबल्स में रहने दें जिनके लिए वास्तव में इसकी आवश्यकता है।
5.5 Sky brightness: one ranking to rule the map
इंटरफ़ेस का संगठनात्मक रूपक एक star map (अनुभाग 8) है, और इस रूपक को एक वास्तविक गणना का समर्थन प्राप्त है। प्रत्येक अवधारणा को एक brightness आवंटित किया जाता है — एक संख्यात्मक परिमाण जिसका उपयोग आकाश को क्रमबद्ध करने के लिए किया जाता है — जो इस बात से व्युत्पन्न होता है कि वह बहुभाषी ग्राफ़ में कहाँ स्थित है: कितनी भाषाओं से शब्द जुड़े हुए हैं, वे शब्द सेट कितने समृद्ध हैं, और अवधारणा वर्गीकरण-विज्ञान में कितनी प्रमुख है। डेटाबेस इसे concept_sky_rank के रूप में मूर्त करता है, जो सभी 96,000+ अवधारणाओं की एक पूर्व-गणना की गई व्यवस्था है, ताकि "मुझे आकाश दो" को कभी भी अनुरोध समय पर एक मिलियन पंक्तियों को क्रमबद्ध करने की आवश्यकता नहीं होती [H] (लिपि और माप, 6 सितंबर 2026)। दो साथी व्यू — concept_lang_rank (प्रति-भाषा रैंकिंग) और concept_word_rank (प्रति अवधारणा प्रति भाषा शीर्ष चार शब्द, "बेक्ड" ताकि किसी स्टार को उसके शब्दों से समृद्ध करना एक लुकअप हो, न कि 1.6 मिलियन अर्थों पर एक जॉइन) — रैंकिंग प्रणाली को पूरा करते हैं [H] (स्क्रिप्ट्स, 6 सितंबर 2026; अनुलग्नक A में पंक्तियों की संख्या)।
5.6 Bounded work: the game-designer's discipline applied to a database
अंतिम डिज़ाइन सिद्धांत वीडियो गेम से लिया गया है। एक गेम 16 मिलीसेकंड में एक फ़्रेम रेंडर करता है, चाहे दुनिया कितनी भी बड़ी क्यों न हो: यह प्रति फ़्रेम काम के लिए बजट निर्धारित करता है। Lingua Mundi इसी अनुशासन को लागू करता है — असीमित डेटा स्पेस पर प्रति क्वेरी सीमित कार्य — क्योंकि इसके हार्डवेयर को इसकी आवश्यकता है (2014-के-युग का एक लैपटॉप; अनुभाग 9)। कोई भी अनुरोध पूरे कॉर्पस को स्कैन नहीं कर सकता; हर अनुरोध को एक इंडेक्स या एक बेक्ड व्यू से शुरू करना होगा; इंटरफ़ेस को केवल तभी रेंडर करना चाहिए जब उपयोगकर्ता कुछ करता है (निष्क्रिय सीपीयू ≈ 0%); और परिणाम स्थिर विंडो के साथ पेजिनेट किए जाते हैं। अनुभाग 6 और 7 दिखाते हैं कि इस अनुशासन ने प्रदर्शन की तीन बाधाओं का सामना किया और प्रत्येक को एक ही पैटर्न से कैसे हल किया गया: बेक करें, दोबारा व्युत्पन्न न करें।
6 · Architecture: importing the world, serving the map
6.1 The pipeline: one registry, twenty-plus importers
हर डेटासेट Lingua Mundi में एक importer के माध्यम से प्रवेश करता है — यह एक प्रोग्राम है जो एक बाहरी प्रारूप को पढ़ना और उसे मानक स्कीमा में लिखना जानता है। आयातकों की एकमात्र आधिकारिक सूची एक फ़ाइल में रहती है, आयातक रजिस्ट्री; सितंबर 2026 तक इसमें बीस से अधिक पंजीकृत प्लगइन्स शामिल थे, जिनमें शामिल हैं: Princeton WordNet और अंग्रेजी WordNet, Open Multilingual Wordnet (OMW), Wiktionary और इसका मशीन-पठनीय व्युत्पन्न kaikki, Wikidata, UniMorph और J-UniMorph (रूपविज्ञान), Universal Dependencies ट्रीबैंक (UD), OpenThesaurus (जर्मन पर्यायवाची), सीएमयू उच्चारण शब्दकोश, IDS character decompositions, CLICS द्विभाषी डेटा, शब्द-आवृत्ति सूचियाँ, और जापानी परिवार — JMdict, EJDict, KANJIDIC2 [H] (आयातक रजिस्ट्री और परियोजना नोट्स, 6–7 सितंबर 2026 को एक्सेस किया गया)। (सटीकता के लिए एक चेतावनी: आयातकों की निर्देशिका में OPUS समानांतर कॉर्पस के लिए एक फ़ोल्डर मौजूद है, लेकिन यह एक खाली, अनपंजीकृत स्टब है जो रोडमैप की वाक्य परत का इंतज़ार कर रहा है — इसे ईमानदारी के लिए यहाँ सूचीबद्ध किया गया है, न कि एक शिप किए गए स्रोत के रूप में [H] (कोड सूची, 6–7 सितंबर 2026)।) प्रत्येक इम्पोर्टर अपनी लक्षित भाषाओं को उन्हीं ISO कोडों के विरुद्ध पंजीकृत करता है, जो व्यावहारिक रूप से स्कीमा को केवल सिद्धांत में ही नहीं, बल्कि भाषा-तटस्थ बनाए रखता है [H] (कोड)।
आयात एक पाइपलाइन द्वारा पर्यवेक्षित होते हैं जो प्रत्येक स्रोत को चलाती है, आयात जॉब को रिकॉर्ड करती है, और — धारा 7 के लिए महत्वपूर्ण रूप से — सफलता की रिपोर्ट करती है। प्रत्येक इम्पोर्ट के बाद यह रैंकिंग व्यूज़ (अनुभाग 5.5) को रिफ्रेश करता है ताकि "sky" हमेशा सबसे ताज़ा डेटा [H] (स्क्रिप्ट्स, सितंबर 2026) को दर्शाता रहे।
6.2 The corpus today (measured)
6 सितंबर 2026 को 23:02 सेंट्रल टाइम पर लाइव डेटाबेस का SQL प्रत्यक्ष मापन, 7 सितंबर 2026 को पुनः सत्यापित (दोनों गणनाएँ समान) [H]:
| Table | Rows |
|---|---|
| concepts (meanings) | 96,434 |
| lexemes (word forms) | 1,238,383 |
| senses (word-dictionary meanings) | 1,608,018 |
| relations (typed concept links) | 171,672 |
| languages (live) | 6 — eng, spa, fra, deu, por, jpn |
प्रति-भाषा शब्दावली भार (समृद्धिकरण ऑडिट, 6 सितंबर 2026 [H]):
| Language | Lexemes | Senses |
|---|---|---|
| Japanese (jpn) | ≈ 345,000 | ≈ 528,000 |
| English (eng) | ≈ 271,000 | ≈ 393,000 |
| German (deu) | ≈ 176,000 | ≈ 203,000 |
| Spanish (spa) | ≈ 152,000 | ≈ 167,000 |
| French (fra) | ≈ 149,000 | ≈ 157,000 |
| Portuguese (por) | ≈ 145,000 | ≈ 160,000 |
इन आंकड़ों के साथ दो ईमानदार चेतावनियाँ जुड़ी हैं। पहली, भाषा-वार आंकड़े अनुमानित हैं (ऑडिट से गोल किए गए हैं); तालिका-स्तर के SQL गणनाएँ अपने मापन के क्षण पर सटीक हैं। दूसरी, कॉर्पस layered है: कुछ डेटासेट (kaikki Wiktionary और शब्द-आवृत्ति सूचियाँ) को जानबूझकर प्रति इम्पोर्ट रन 50,000 पंक्तियों पर सीमित किया गया था, और गहरी कवरेज अन्य स्रोतों द्वारा प्रदान की गई थी, और वह सीमा छिपाई नहीं गई है बल्कि दस्तावेजीकृत [H] है (ऑडिट, 6 सितंबर 2026)। अनुभाग 7 में दिखाया गया है कि जब एक समान सीमा को एक जोखिम के रूप में not दस्तावेजीकृत किया गया था तो क्या हुआ।
6.3 The API surface
यह सिस्टम एक छोटा, जानबूझकर स्थिर HTTP API (FastAPI) उजागर करता है, जिसकी Phase-0 सतह को इस तरह प्रलेखित किया गया है कि जैसे-जैसे नए चरण आते हैं, यह कभी टूटेगी नहीं। [H] (प्रोजेक्ट नोट, 29 अगस्त 2026)। एंडपॉइंट्स, जो सितंबर 2026 [H] में लाइव सत्यापित हैं:
/languages— लाइव भाषाओं और उनके मेटाडेटा को सूचीबद्ध करें;/lexemesऔर/concepts— पन्नीकृत सूची क्वेरीज़ (सीमा/ऑफसेट, सीमित
1,000 प्रति पृष्ठ के बाद, अगस्त-सितंबर के एक ऑडिट में यह पाया गया कि वे अनबाउंड थे);
/analyze— एक शब्द का रूपगत/शब्दावली विश्लेषण;/kanjiऔर/lookup— जापानी कांजी और शब्दकोश लुकअप;/graph/sky— स्टार-मैप फ़ीड: आकाश की चमक के अनुसार रैंक किए गए अवधारणाएँ, के साथ
खोज के लिए पैरामीटर (query, lang), गहराई (skip/स्तर), कि क्या सदस्य शब्द संलग्न करें (words), और एक taxonomy lens (anchor, lens=up|down) जो एक दिए गए से is-a वृक्ष पर चढ़ता या उतरता है अवधारणा;
/graph/star/{id}— एक तारा पूर्ण रूप से: इसकी सदस्य शब्द प्रति भाषा और
इसके पड़ोसी अवधारणाएँ, दोनों पृष्ठबद्ध;
/graph/path— दो के बीच सीमित ग्राफ़ खोज (अनुभाग 5.3)
अवधारणाएँ;
/graph/word— "शब्द लेंस": एक शब्द और एक भाषा दिए जाने पर, अवधारणाएँ
वर्तमान में इसकी इंद्रियाँ जुड़ी हुई हैं।
सभी प्रतिक्रियाएँ संपीडित (gzip) हैं, और प्रत्येक क्वेरी को एक इंडेक्स या एक मैटेरियलाइज़्ड व्यू से चलाने के लिए डिज़ाइन किया गया है — अनुभाग 5.6 का "बाउंडेड वर्क" नियम [H] (कोड और लाइव हेडर, सितंबर 2026)।
6.4 Why the design is language-agnostic in the database, not just on paper
अब पाठक पूरा लूप देख सकता है। एक नई भाषा एक language पंक्ति (जैसे, मंदारिन, कोड cmn) और पंजीकृत डेटासेट (OMW मंदारिन वर्डनेट, एक UD मंदारिन ट्रीबैंक) के रूप में आती है। आयातक इसके शब्द-रूप, अर्थ, और — जहाँ OMW या अन्य स्पष्ट मैपिंग मौजूद हैं — इसके अर्थ→अवधारणा लिंक लिखते हैं। रैंकिंग व्यूज़ पुनःगणना करते हैं; आकाश को एक नई भाषा मिलती है; कोई तालिका परिवर्तन नहीं; कोई प्रवासन नहीं; API में कोई विशेष मामला नहीं। इस सटीक पथ के साथ नियोजित अगला परिवार — मैंडरिन, कैंटोनीज़, कोरियाई और वियतनामी — में वर्णित है अनुभाग 10.3, जहाँ डेटा-उपलब्धता की टोही जिसका निर्णय इसकी समय-सारणी तय करेगी, [H] (सत्र लॉग, 7 सितंबर 2026) में दर्ज है। इस डिजाइन का वादा — "असीमित रूप से भाषाएँ जोड़ें" — इसलिए विपणन नहीं है: यह स्कीमा का सीधा परिणाम है।
7 · Two infrastructure lessons: bake-don't-re-derive, and fail-loud
हर डेटाबेस प्रोजेक्ट को अंततः अपनी प्रदर्शन की दीवारों का सामना करना पड़ता है। Lingua Mundi को एक ही सप्ताह में ऐसी तीन दीवारों का सामना करना पड़ा — और फिर उसने पाया कि सबसे दिलचस्प समस्या गति नहीं बल्कि खामोशी थी। यह खंड दोनों कहानियाँ बताता है, क्योंकि मिलकर ये प्रोजेक्ट के सबसे अधिक हस्तांतरणीय इंजीनियरिंग सबक हैं।
7.1 The pattern: bake, don't re-derive
तीनों प्रदर्शन बाधाओं को हल करने वाला नियम एक वाक्य में कहने के लिए काफी सरल है: जब कई क्वेरीज़ को एक ही महंगी गणना की आवश्यकता होती है, तो उसे एक बार करें, परिणाम को संग्रहीत करें, और उसे ताज़ा रखें — हर क्वेरी के लिए उसे फिर से न करें। डेटाबेस की शब्दावली में, Lingua Mundi, PostgreSQL मैटेरियलाइज़्ड व्यूज़ का उपयोग करता है: पूर्व-गणना किए गए तालिकाएँ जो उत्तरों से भरे सूचकांकों की तरह काम करती हैं।
- Wall 1 — ranking the sky. मूल रूप से, डिफ़ॉल्ट स्टार मैप के लिए पूछना
पूरे कॉर्पस per request को फिर से रैंक करने के लिए डेटाबेस को मजबूर किया: इसके बारे में परियोजना के 2014-युग के लैपटॉप पर हर बार 8.6 सेकंड। फिक्स ने बेक किया concept_sky_rank और concept_lang_rank में रैंकिंग (94,498 और 218,120 पूर्व-गणना की गई पंक्तियाँ), जिसके बाद डिफ़ॉल्ट आकाश ने उत्तर दिया ~0.25 s और गहरी अनुरोधों को दसियों मिलीसेकंड में [H] (मापा गया, 6 सितंबर 2026).
- Wall 2 — naming the stars. आसमान मांगना with its words
संलग्न (प्रत्येक भाषा में प्रति अवधारणा शीर्ष शब्द) 1.6 में क्रॉस-जॉइनिंग आवश्यक हर अनुरोध पर million senses; 1,000 सितारों पर क्वेरी ने से अधिक लिया एक मिनट — एक रोगजन्य मामला। फिक्स ने स्वयं शब्दों को ही पका दिया: concept_word_rank प्रत्येक अवधारणा के लिए शीर्ष चार शब्दों की पूर्व-गणना करता है। भाषा (निर्माण के समय 338,378 पंक्तियाँ), एक मिनट से अधिक समय वाले जॉइन को एक में बदलना ~1.1 s लुकअप, और डिफ़ॉल्ट व्यू ~0.25 s [H] (मापा गया, 6 सितंबर 2026).
- Wall 3 — hierarchy and pagination. चढ़ना और उतरना
टैक्सोनॉमी (लेंस ऊपर/नीचे) और तारों की स्थिर खिड़कियों के माध्यम से पन्ने पलटना थे कैनोनिकल प्रेडिकेट्स, इंडेक्स ऑर्डरिंग, और स्टेबल पेजिनेशन के साथ हल किया गया। ग्राफ़ डेटाबेस के बजाय विंडोज़ (DISTINCT ON-शैली की क्वेरीज़) — अगस्त "लीन स्टैक" निर्णय (अनुभाग 4.5) का लाभ [H] (कोड और माप, 6 सितंबर 2026)।
प्रत्येक इम्पोर्ट के बाद व्यूज़ स्वचालित रूप से रिफ्रेश हो जाते हैं, इसलिए "बेक्ड" का मतलब कभी भी "स्टेले" नहीं होता [H] (स्क्रिप्ट्स)। पूरा पैटर्न उस बात का एक डेटाबेस-नेटिव उदाहरण है जिसे गेम डेवलपर्स बजटिंग कहते हैं: महंगा काम एक बार, क्रिटिकल पाथ से हटकर होता है, और उपयोगकर्ता का अनुरोध केवल पहले से गणना किए गए उत्तरों को ही पढ़ता है।
7.2 The silent truncation that hid cat
अगस्त 2026 के अंत में कॉर्पस की अंग्रेजी परत को एक रो कैप के साथ आयात किया गया था, जिसे कोई भी वास्तव में कैप नहीं बनाना चाहता था। निगरानी करने वाली आयात स्क्रिप्ट ने अंग्रेजी Open Multilingual Wordnet आयात को 50,000 तक सीमित कर दिया उम्मीदवार — and then reported success [H] (सत्र लॉग, 6 सितंबर 2026, मूल-कारण प्रविष्टि)। अंग्रेजी cat फ़ाइल के वर्णानुक्रम में उम्मीदवार number 52,195 है। इसे काट दिया गया था। 117,659 अंग्रेजी सिनसेट्स में से लगभग 21,830 कभी बनाए ही नहीं गए; उन अर्थों के लिए, अंग्रेजी सेंस कच्ची शब्दकोश प्रविष्टियों के रूप में मौजूद थे लेकिन उन्हें कभी अवधारणाओं से नहीं जोड़ा गया। शब्द cat डेटाबेस से गायब नहीं था — वह नक्शे में अदृश्य था: इसके अर्थ की खोज में वह नहीं मिला, क्योंकि जिस अर्थ-नोड [H] (समान स्रोत) की ओर इसकी संवेदनाओं को इंगित करना चाहिए था, वह कभी बनाया ही नहीं गया था।
लगभग छह दिनों तक, किसी को पता नहीं चला। लेखक को जिस डेमो की परवाह थी — cat · gato · 猫 एक सितारे पर — वह स्पेनिश और जापानी में काम करता था लेकिन अंग्रेज़ी में खाली हाथ रहा, और यह खाली परिणाम एक डेटा गैप जैसा दिख रहा था — मानो अंग्रेज़ी में वह शब्द ही न हो। (रिकॉर्ड से एक समय-संबंधी नोट: बहु-भाषाई आकाश स्वयं ही केवल आया जब integrate_core6.py ने अगस्त–सितंबर इम्पोर्ट रन के अंत के करीब आयात की गई भाषाओं को लिंक करना समाप्त किया — उससे पहले फॉलबैक स्काई एक छोटा एक-भाषा वाला दृश्य था — यही कारण है कि अंग्रेजी का यह खालीपन केवल सितंबर की शुरुआत में सामने आया, जब साझा-अवधारणा वाला दृश्य वास्तव में लाइव [H] था। (सत्र लॉग, 6 सितंबर 2026)।) सत्र लॉग में दर्ज लेखक की अपनी ज़िद थी कि यह "not a data gap — infrastructure" [H] था (सत्र लॉग, 6 सितंबर 2026)। वह सही था। विफलता डेटा में नहीं बल्कि पाइपलाइन की ईमानदारी में थी: एक अधूरे आयात ने सफलता की सूचना दी थी, और सिस्टम में ऐसा कुछ भी डिज़ाइन नहीं किया गया था जो यह ध्यान दे कि 50,000-पंक्तियों की सीमा वाली "सफलता" का मतलब उम्मीदवार 52,195 के लिए विफलता था।
7.3 The fix: an uncapped, idempotent repair chain
मरम्मत — जिसे 6–7 सितंबर 2026 को डिज़ाइन और लॉन्च किया गया और 8 सितंबर 2026 को पूर्ण के रूप में सत्यापित किया गया (देखें अनुभाग 10.1) — यह दर्शाने का एक मॉडल है कि डेटा खोए बिना एक डेटा पाइपलाइन कैसे ठीक की जाए या विश्वास [H] (स्क्रिप्ट और सत्र लॉग, 6–7 सितंबर 2026):
- Re-import the English WordNet without the cap — इडेम्पोटेंट रूप से, इसलिए एक
बाधित रन को पंक्तियों को दोहराए बिना आसानी से फिर से शुरू किया जा सकता है;
- नए बनाए गए synsets के लिए re-run the synset-to-synset relations;
- integrate: नए सिनसेट्स को कॉन्सेप्ट्स में प्रमोट करें, सदस्य अर्थों को लिंक करें।
concept_id क्षेत्रों, और अवधारणा संबंधों को पुनः व्यक्त करें;
- refresh the materialized views तो नक्शा मरम्मत किए गए को दर्शाता है
कोष; और
- verify end-to-end एक स्वीकृति स्क्रिप्ट के साथ जो से साबित करती है,
डेटाबेस और लाइव API के माध्यम से, वह अंग्रेज़ी cat पहुँचती है घरेलू-बिल्ली अवधारणा princeton-wordnet:02121620-n अपने साथ बहुभाषी सदस्य — gato, chat, Katze, 猫 — और कि अवधारणा के टैक्सोनॉमी अभिभावक हैं। स्वीकृति जाँच को होने के लिए डिज़ाइन किया गया है। किसी भी समय दोबारा चलाएँ और ज़ोर से 'पास' या 'फेल' कहकर बाहर निकलें।
क्योंकि हर कदम को इडेम्पोटेंट (get-or-create, skip-if-exists) बनाने के लिए लिखा गया था, मरम्मत के बीच मशीन के क्रैश होने पर केवल समय की हानि होती है: चेन को फिर से शुरू किया जा सकता है और यह काम पूरा कर देगी। यही गुण लाइव डेटाबेस को आंशिक राज्यों से बचाता है।
7.4 The lesson: fail-loud vs. fail-silent
cat प्रकरण एक ऐसी समस्या का पाठ्यपुस्तक-सा मामला है जिससे हर डेटा इंजीनियर डरता है: a pipeline that fails silently and reports success. पद्धतिगत सबक — कि एक पंक्ति कैप सफलता का मानदंड नहीं है, और यह कि आयातकों को केवल पूर्णता नहीं, बल्कि सम्पूर्णता की भी पुष्टि करनी चाहिए — को ओपन-डेटा बुनियादी ढांचे के लिए एक सामान्य सिद्धांत के रूप में बताना सार्थक है, जहाँ डेटासेट बिना किसी गारंटी के आते हैं और पाइपलाइनों को हाथ से जोड़ा जाता है। Lingua Mundi की प्रतिक्रिया को दो रूपों में संस्थागत बनाया गया था: स्वीकृति स्क्रिप्ट कि कोई भी भविष्य आयात श्रृंखला चला सकता है, और स्टूडियो का स्थायी नियम कि अप्रमाणित दावों को अप्रमाणित लेबल किया जाता है — डेटाबेस में (अनाथ संवेदनाओं को दिखाई देने वाला रखा गया, लिंक पर विश्वास स्तर) और हर लिखित रिकॉर्ड में (इस पेपर की [H]/[O]/[NV] परंपरा, परिशिष्ट A)। एक ऐसी प्रणाली जो अपनी अनाथ प्रविष्टियों को दिखा सकती है, वह एक ऐसी प्रणाली है जिनकी खामियों को खोजा जा सकता है। एक ऐसी प्रणाली जो उन्हें छिपाती है, वह एक ऐसी प्रणाली है जिनकी खामियों को खोज लिया जाएगा — अंततः, सबसे बुरे संभावित व्यक्ति द्वारा: cat की तलाश करने वाला एक उपयोगकर्ता।
8 · The interface: a star map of meaning
डेटा अकेले कोई उत्पाद नहीं है। Lingua Mundi के इंटरफ़ेस को आकार देने वाला सवाल सरल था: what should looking at a map of meaning feel like? लेखक का उत्तर, जो सितंबर 2026 के पहले सप्ताह के दौरान विकसित हुआ, यह था कि यह आसमान को देखने जैसा महसूस होना चाहिए — और, विशेष रूप से, एक काल्पनिक खजाने वाले ग्रह के चार्ट जैसा: एक ब्रह्मांड का नेविगेबल कागज़ का नक्शा जहाँ प्रत्येक तारा एक विचार है, और भाषाएँ वे दूरबीनें हैं जिनके माध्यम से आप उसे देखने का चुनाव करते हैं [H] (सत्र लॉग, 1–7 सितंबर 2026)। यह खंड उस इंटरफ़ेस का वर्णन करता है जो इसका परिणाम था: इसका शैक्षिक रूपक, इसकी दृश्य भाषा, इसके उपकरण, और वह इंजीनियरिंग अनुशासन जो इसे 2014 के लैपटॉप पर चलाने में सक्षम बनाता है।
8.1 From dictionary page to sky: naming the product
इंटरफ़ेस ने दो हफ्तों में तीन पहचानों से गुज़रा, और नाम उत्पाद के विकास को ट्रैक करते हैं [H] (सत्र लॉग, 31 अगस्त – 6 सितंबर 2026)। यह एक साधारण शब्दकोश पृष्ठ के रूप में शुरू हुआ ("/gui/", जिसे कहा जाता है 31 अगस्त को एक वेधशाला), 1 सितंबर को Planetarium बन गया जब डेटा आयात समाप्त हो गए और एक स्टार-फील्ड विज़ुअलाइज़ेशन दिखाई दिया, और — लेखक द्वारा परिणाम को देखने और सितारों को "scaffolding, not the product" घोषित करने के बाद — 6 सितंबर की रात को एक सेमांटिक-ग्राफ़ एक्सप्लोरर में बदल गया: वही आकाश, लेकिन अब the point अर्थ था, जिसमें नोड्स उन अवधारणाओं के लेबल थे जिन्हें आप सक्षम करते हैं, एज संबंध परिवार के अनुसार रंगीन थे, और खोज जो अर्थों को स्पष्ट करती है। पुराना आकाश दृश्य संरक्षित तो था लेकिन उससे जुड़ा नहीं था; एक्सप्लोरर Lingua Mundi [H] का डिफ़ॉल्ट चेहरा बन गया (सत्र लॉग, 6 सितंबर 2026)।
8.2 The pedagogical metaphor: an instrument, not a dashboard
इंटरफ़ेस का हर तत्व खगोल विज्ञान और स्वयं भाषा परियोजना की एक अवधारणा से एक-से-एक मेल खाता है — एक जानबूझकर किया गया शैक्षिक डिज़ाइन (रूपक तालिका उत्पाद का आंतरिक दस्तावेज़ीकरण है) [H] (सत्र लॉग, 6–7 सितंबर 2026):
| Star-map element | What it really is |
|---|---|
| A star | A concept — one meaning, shared across languages |
| The stars' brightness (magnitude) | A concept's lexical richness and connectedness (Section 5.5) |
| The language you look through | A telescope — the same sky seen in Spanish, English, Japanese… |
| Constellations and threads | Families of relations — the is-a taxonomy drawn as plotted course lines |
| Zooming in | Descending from the wide sky to a single star and its neighborhood (the Hipparcos→Gaia idea — Gaia Collaboration et al. (2018): more detail the deeper you go) |
| The exposure dial | Deepening the field — asking for more and dimmer stars around a focus |
| The sextant | Measuring a route between two meanings through the taxonomy |
| Skymarks | Bookmarks on stars |
| The word compass | The enabled languages, ringing the focused star as word chips |
| The course log | Your exploration trail — how you arrived at this meaning |
यह सब सजावट नहीं है; इस उपकरण के लिए लेखक का डिज़ाइन ब्रीफ रिकॉर्ड में उद्धृत है और इसे दोहराना सार्थक है: इंटरफ़ेस "एक वास्तविक खोज उपकरण होना चाहिए, खिलौना नहीं" — एक ऐसा मानचित्र जो सभी भाषाओं को दर्शाता हो, जिसे कोई सीखने वाला या शोधकर्ता वास्तव में खोज सके — और इसके स्रोत एक नेविगेबल कागज़ी नक्शे की तरह काम करने चाहिए, न कि एक डैशबोर्ड [H] की तरह (सत्र लॉग, 6 सितंबर 2026)। इसी भावना में उपकरण पैनल जानबूझकर skeuomorphic हैं: पीतल के नॉब वाले एक्सपोजर डायल, सेक्स्टेंट माप, चार्ट किए गए मार्ग, एक युगांतर स्टाम्प — एक पुराने वेधशाला की सौंदर्य-दृष्टि, जिसे मेनू लेबल के बजाय स्पर्श द्वारा सिखाने के लिए चुना गया है।
8.3 What is on screen
अन्वेषक, सितंबर 2026 में [H] के साथ एंड-टू-एंड सत्यापित, प्रदान करता है:
- Search with sense disambiguation. टाइप करने पर gato (स्पेनिश) लौटता है
अर्थ-तारे; प्रत्येक परिणाम दिखा सकता है कि कौन से शब्द किन भाषाओं में साझा करते हैं अर्थ — घरेलू-बिल्ली सितारे का पैनल अपना प्रदर्शन करता है बहुभाषी सिनसेट सदस्य, उदाहरण के लिए अंग्रेज़ी cat और grimalkin, जर्मन Katze, जापानी 猫 (अनुभाग 8.5).
- Travel. एक सितारे पर क्लिक करें (या शिफ्ट-क्लिक करें / माप कुंजी दबाएँ) बनाने के लिए
यह केंद्र बिंदु है; आकाश इसका केंद्र बन जाता है और इसके आसपास का क्षेत्र प्रकट होता है।
- The star panel. केंद्रित तारे के प्रति भाषा सदस्य, इसकी
परिभाषा, और उसके पड़ोसी — बड़े पड़ोसों के लिए पृष्ठीकरण के साथ।
- The taxonomy lens. एक तारे के माता-पिता तक चढ़ें ("यह किस प्रकार का है
के?") या इसके उप-श्रेणियों तक उतरना ("इसकी कौन-कौन सी किस्में हैं?") के साथ कैनोनिकल is-a-परिवार के प्रिडिकेट्स।
- The instruments (सभी लाइव, सत्यापित): exposure dial चौड़ा करता है
कदमों में केंद्रित तारों का क्षेत्र (90 → 180 → 360 → 720 → 1,000 तारे), बिना दोबारा यात्रा किए व्यापक आकाश का विलय; sextant एक मापता है दो सितारों के बीच सीमित ग्राफ़ पथ (खंड की /graph/path खोज 5.3), आकाश में एक खंडित सुनहरा मार्ग खींचना और प्रत्येक चरण को दर्ज करना; skymarks पिन सितारे (स्थानीय रूप से बनाए रखे गए, ताकि आपका अपना छोटा तारामंडल रिलोड्स से बचता है); word compass शब्द के साथ केंद्रित तारे को घेरे चिप्स — प्रत्येक सक्षम भाषा के लिए एक, खोज बदलने के लिए क्लिक करने योग्य भाषा; और course log, home bearing, epoch stamp, and reticle आपको सूचित रखता है [H] (सत्र लॉग, 7 सितंबर 2026)।
- The support affordance. एक "✦ समर्थन" नियंत्रण दान खोलता है
मोडल (धारा 10).
8.4 Engineering the sky on 2014 hardware
इंटरफ़ेस की सुंदरता एक कठोर शर्त के अधीन है: इसे 2014-युग के प्रोसेसर, 8 जीबी रैम और एक स्पिनिंग डिस्क वाली मशीन पर सुचारू रूप से चलाना चाहिए — वही मशीन जो डेटाबेस को होस्ट करती है। इसे संभव बनाने वाली इंजीनियरिंग का दस्तावेजीकरण करना महत्वपूर्ण है क्योंकि यह सेक्शन 7 के समान bounded work अनुशासन है, जिसे पिक्सल [H] पर लागू किया गया है (ऑडिट और सत्र लॉग, 6–7 सितंबर 2026):
- The page renders only on input. निष्क्रिय सीपीयू उपयोग ~0%; कुछ भी नहीं
जब तक उपयोगकर्ता कुछ न करे तब तक एनिमेट करता रहता है। कोई निरंतर नहीं है। एनिमेशन — "आलू बजट" (धारा 9) के तहत एक जानबूझकर किया गया चुनाव।
- The nebula is baked. सजावटी पृष्ठभूमि (बैंगनी/टील/गुलाबी
(ब्लूम्स और धूल) प्रत्येक पुनः आकार देने पर एक बार चित्रित किया जाता है और फिर कैश किया जाता है, के साथ कैमरा पैरेलाक्स को हर फ्रेम में फिर से गणना करने के बजाय, दोबारा ड्रा करने पर सेट किया गया।
- Labels are rationed. केवल ~24 स्टार लेबल प्रति फ्रेम खींचे जाते हैं — एक
लेबल बजट — रीड्रॉ को सस्ता और टेक्स्ट को पठनीय बनाए रखना [H] (the MAX_LABELS = 24 के साथ इंटरफ़ेस कोड प्लेसमेंट्स; gui/planetarium-v1.html).
- Requests are protected. पुराने प्रतिक्रिया टोकन और रद्द नियंत्रण
जब उपयोगकर्ता आगे बढ़ता है तो उड़ान के दौरान के प्रश्न रद्द करें; डबल-क्लिक से स्थगित करें एकल-क्लिक क्रियाएँ ताकि व्यर्थ फ़ेच कॉल न हों; पुनःआकार परिवर्तन डिबॉन्स्ड होते हैं और कैनवास पिक्सेल अनुपात सीमित है (एक पुनःआकार की मेमोरी को सिकोड़ते हुए ~24 एमबी से ~11 एमबी (1080p पर)।
- Accessibility is explicit: कैनवास रोल्स और एरिया लेबल, कम गति
समर्थन और कीबोर्ड ट्रैवल, दृश्य के साथ ही एक ही पास में जोड़े गए। पॉलिश [H] (सत्र लॉग, 7 सितंबर 2026)।
8.5 The demo that ties it together
परियोजना का चलता-फिरता प्रदर्शन cat शब्द है — या यूँ कहें कि वह अवधारणा जिससे यह संबंधित है। एक्सप्लोरर में स्पेनिश gato खोजें, तारे तक यात्रा करें, और पैनल लाइव भाषाओं में अपने सदस्यों के साथ synset princeton-wordnet:02121620-n दिखाता है। वास्तव में 6–7 सितंबर 2026 के हेडलेस चेक्स में एंड-टू-एंड सत्यापित उपसमूह को टेस्ट लॉग में दर्ज किया गया है — अंग्रेज़ी cat, grimalkin और felis silvestris catus (वैज्ञानिक नाम WordNet स्टोर्स), जर्मन Katze, स्पेनिश gato, जापानी 猫 — और व्यापक सदस्य सूचियाँ उस सिन्सेट के लिए डेटाबेस स्टोर्स हैं (जैसे अंग्रेजी housecat, mouser, puss, tomcat; फ्रेंच chat, chatte; जर्मन Kater; जापानी ネコ; पुर्तगाली gato, bichano) आयातित वर्डनेट सदस्यता से आते हैं, न कि एंड-टू-एंड लॉग से; कोई पाठक जो पूरी वर्तमान सूची चाहता है, वह अनुभाग 7.3 की स्वीकृति क्वेरी को फिर से चला सकता है [H with [NV] on the untested tail] (हेडलेस E2E लॉग और लाइव डेटाबेस, 6–7 सितंबर 2026)। एक सितारा, छह भाषाएँ, एक अर्थ: दिसंबर 2025 की अंतर्दृष्टि, स्क्रीन पर दिखाई दे रही है। इस प्रदर्शन का अंग्रेज़ी पक्ष ठीक वही है जिसे अनुभाग 7.2 की बग ने संक्षेप में तोड़ा था: एक स्पेनिश-संचालित gato खोज शुरू से ही स्टार तक पहुँच गई, जबकि एक अंग्रेज़ी-संचालित cat खोज केवल कवरेज मरम्मत के बाद ही काम करती है, और अनुभाग 7.3 की स्वीकृति स्क्रिप्ट ठीक इसी बात को साबित करने के लिए मौजूद है, मांग पर, कि cat · gato · 猫 अपना तारा साझा करते हैं।
9 · The workbench: tools, workflow, and the "potato" machine
एक प्रोजेक्ट का इतिहास उस वर्कबेंच के बिना अधूरा है जिस पर उसे बनाया गया था। Lingua Mundi का वर्कबेंच असामान्य है, और इसने जो प्रतिबंध लगाए, उन्होंने इस पेपर के लगभग हर इंजीनियरिंग निर्णय को आकार दिया।
9.1 The potato
डेटाबेस, API, इंटरफ़ेस और डेवलपमेंट एनवायरनमेंट को होस्ट करने वाली मशीन एक सामान्य कंज्यूमर लैपटॉप है: एक ASUS X751MA जिसमें Intel Pentium N3540 (Bay-Trail, four cores, no AVX2), 8 GB की रैम है। (7.6 जीआईबी उपयोग योग्य), एक 5400 rpm hard disk, और लगभग 47 KB/s का एक इंटरनेट अपलिंक — जिसे इस पेपर के लिए 7 सितंबर 2026 को लाइव कैप्चर किया गया था। ([H], lscpu//proc/meminfo मशीन पर स्वयं)। प्रोजेक्ट के नोट्स में इसी मशीन का विभिन्न रूप से वर्णन एक Atom Z36xx/Z37xx या एक Pentium N3540 के रूप में किया गया है — जो अलग-अलग नामों के तहत एक ही Bay-Trail सिलिकॉन परिवार है। [O]; 2026 की पिछली चैट रिकॉर्ड में भी एक अलग प्रोफ़ाइल (एक इंटेल जैस्पर लेक "N5105" मशीन) का संदर्भ है, जिसे अनुभाग 10.2 एक अनसुलझा हार्डवेयर-रिकॉर्ड संघर्ष के रूप में सूचीबद्ध करता है। स्टूडियो इस लाइव बॉक्स को स्नेहपूर्वक the potato कहता है — और इसने एक नियम बनाया जो पूरे रिकॉर्ड में दिखाई देता है: one heavy operation at a time, मेमोरी-गार्ड वाले रैपर, कोई स्थायी एनिमेशन नहीं, कोई समय-पूर्व बुनियादी ढांचा नहीं (अनुभाग 4.5), और हर भारी काम एक स्व-चेतावनी देने वाली अलग स्क्रिप्ट के रूप में चले जो पोल किए जाने के बजाय, पूरा होने पर रिपोर्ट करे [H] (सत्र लॉग और टूलिंग, सितंबर 2026)। "बेक, दोबारा व्युत्पन्न न करें" पैटर्न (अनुभाग 7), केवल-इनपुट इंटरफ़ेस (अनुभाग 8.4), और शून्य-एलएलएम-लागत शोध सतह (अनुभाग 9.4) सभी, मूल रूप से, 'पोटैटो' के परिणाम हैं — यह प्रमाण है कि एक तंग बजट एक सीमा के बजाय एक डिज़ाइन सद्गुण हो सकता है।
9.2 The software stack
चलाने वाला सिस्टम (सत्यापित लाइव, सितंबर 2026 [H]): PostgreSQL 16 के रूप में एकल डेटास्टोर (अनुभाग 4.5), FastAPI (पाइथन) के रूप में API परत, मॉडलों और माइग्रेशन के लिए SQLAlchemy + Alembic, इम्पोर्टरों और मैटेरियलाइज़्ड-व्यू प्रबंधन के लिए पाइथन स्क्रिप्ट, और एक छोटा निर्भरता-मुक्त वेब इंटरफ़ेस (HTML/CSS/JavaScript) जो उसी मूल से परोसा जाता है। सहायक मशीनरी में systemd उपयोगकर्ता सेवाएँ शामिल हैं जो API और मेमोरी/थर्मल गार्ड को चालू रखते हैं (अनुभाग 9.5), कोडबेस का एक दैनिक GitHub बैकअप, प्रोजेक्ट मेमोरी के रूप में एक ऑब्सीडियन ज्ञान आधार (अनुभाग 9.3), इंटरफ़ेस के लिए हेडलेस-Chromium एंड-टू-एंड जाँच, और स्टूडियो का detach-run + notify टूलिंग स्व-चेतावनी पृष्ठभूमि के लिए [H] नौकरियों (सेवाओं और टूलिंग इन्वेंटरी, सितंबर 2026) के लिए स्टूडियो की detach-run + notify टूलिंग।
9.3 The knowledge base: a project memory that can be audited
26 अगस्त 2026 से लेखक और उसके एजेंटों ने एक संरचित ज्ञान आधार (एक ऑब्सीडियन वॉल्ट) बनाए रखा जिसमें हर कार्य सत्र लॉग किया जाता है: किया गया काम, लिए गए निर्णय, अगली कार्रवाइयाँ, और वह फ़ाइल जहाँ से प्रत्येक तथ्य लिया गया है, साथ ही फ्रंटमैटर में उत्पत्ति का रिकॉर्ड और एक verified: true/false झंडा [H] (वॉल्ट कन्वेंशन, अगस्त–सितंबर 2026) होता है। इस भंडार (vault) की ही वजह से यह लेख तारीखों और उद्धरणों का हवाला दे पाता है: जब यह मसौदा "सत्र लॉग, 6 सितंबर 2026" कहता है, तो यह एक ऐसी फ़ाइल की ओर इशारा कर रहा होता है जो मौजूद है, जिसे उसी दिन लिखा गया था, और जिसमें अपने स्वयं के स्रोत नोट्स होते हैं। उस वॉल्ट की दो परंपराओं का उल्लेख method के रूप में किया जाना चाहिए: हर दावे में अपना स्रोत बताना चाहिए, और इतिहास कभी गढ़ा नहीं जाता — अप्रमाणित सामग्री को रखा तो जाता है लेकिन उसे अप्रमाणित [H] के रूप में चिह्नित किया जाता है (वॉल्ट की परंपराएँ)। वे परंपराएँ इस पत्र की परंपराएँ हैं (परिशिष्ट A)।
9.4 Zero-token research and the local-first rule
लेखक का स्थायी नियम — जो 29 अगस्त 2026 की परियोजना नोट में दिखाई देता है — यह है कि स्थानीय API is अनुसंधान सतह: /lexemes, /concepts, /analyze कॉर्पस के बारे में zero LLM tokens खर्च किए गए [H] के साथ प्रश्नों का उत्तर देता है। वही स्थानीय-प्रथम प्रवृत्ति डेटा (सब कुछ स्व-होस्ट किया गया; कुछ भी किसी विक्रेता पर निर्भर नहीं है), धन (केवल मुफ्त स्तर और खुला डेटा; अनुभाग 10), और गोपनीयता (गुप्त जानकारी कभी भी मशीन से बाहर नहीं जाती; ज्ञान आधार निजी है) [H] (सत्र लॉग, सितंबर 2026)।
9.5 Guardrails on a fragile machine
चूंकि आलू के पास हेडरूम नहीं था, स्टूडियो ने गार्डरेल बनाए जो स्वयं इंजीनियरिंग की कहानी का हिस्सा हैं: एक memory/thermal guard (tools/mem-manager.sh, v2, लाइव 7 सितंबर 2026) जो 900 MiB से नीचे उपलब्ध मेमोरी या 80 °C और 500 MiB या 88 °C से नीचे वैकल्पिक बैकग्राउंड यूनिट्स को हटाने की चेतावनी देता है, साथ ही एक सिस्टम-स्तर का अर्ली-ओम किलर (earlyoom -m 8 -s 5, यानी यह तब कार्य करता है जब फ्री मेमोरी 8% से नीचे आ जाती है, 5-सेकंड के अंतराल पर) [H] (लाइव कॉन्फ़िगरेशन: mem-manager.sh थ्रेशोल्ड्स और /etc/default/earlyoom, 7 सितंबर 2026 को पढ़ें। स्टूडियो के परिचालन नियम उन सुरक्षा उपायों को कभी भी सक्रिय होने से रोकते हैं: one heavy operation at a time, मेमोरी-सुरक्षित रैपर, और सभी लंबे समय तक चलने वाले कार्यों के लिए स्व-चेतावनी देने वाले अलग किए गए जॉब्स। लंबी मरम्मतों को idempotent (get-or-create, skip-if-exists) के रूप में लिखा जाता है ताकि कोई भी रुकावट — एक रीबूट, बिजली की कटौती, एक गार्ड त्रुटि — की कोई कीमत नहीं होती सिवाय समय के: मरम्मत को बस फिर से शुरू किया जा सकता है और यह काम पूरा कर देगी (अनुभाग 7.3)। यही अनुशासन कंकुरेंसी को भी एक संसाधन मानता है जिसके लिए बजट बनाया जाना है, जैसे मेमोरी या डिस्क।
9.6 Governance: licenses, attribution, and the "free forever" decision
Lingua Mundi में प्रत्येक डेटासेट को उसके लाइसेंस के साथ दर्ज किया गया (रिपॉजिटरी की docs/DATA_LICENSES.md इन्वेंट्री; लाइव डेटाबेस की source टेबल) [H]: WordNet (अनुमतिपरक), Open Multilingual Wordnet (प्रति-भाषा लाइसेंस, मुख्य रूप से CC BY-SA और CC BY), Wiktionary और kaikii (CC BY-SA, GFDL के पुराने नियमों के साथ), Wikidata (CC0), UniMorph (CC BY-SA 3.0), Universal Dependencies (CC BY-SA 4.0), JMdict/KANJIDIC2 और EDRDG परिवार (अनुमतिपरक, श्रेय सहित), OPUS (प्रति-डेटासेट), CLICS और शब्द-आवृत्ति सूचियाँ (प्रति-स्रोत), और इसी तरह [H] (लाइसेंस सूची, सितंबर 2026 में एक्सेस किया गया)। यह परियोजना बदले में भी ऐसा ही करती है: इसके अपने आउटपुट को भी मुक्त बनाने की योजना है।
funding model का सार्वजनिक विकास अगस्त 2026 के अंत/सितंबर की शुरुआत में नौ दिनों में हुआ, और रिकॉर्ड प्रत्येक चरण [H] (सत्र लॉग और कैलेंडर, 29 अगस्त – 7 सितंबर 2026) को दर्शाता है: 29 अगस्त को एक ऑफ़लाइन कोर-6 डिक्शनरी ऐप (Texupan, $29 या $9/महीना) बेचने की एक प्रारंभिक योजना; 1 सितंबर तक store hub पर भुगतान लिंक के साथ एक स्टोर लिस्टिंग; और — 7 सितंबर तक — एक निर्णय कि Lingua Mundi को free forever बनाया जाए, जिसे स्वैच्छिक दान से वित्त पोषित किया जाएगा, और Stripe उत्पाद का नाम शाब्दिक रूप से "Lingua Mundi — इसे हमेशा के लिए मुफ्त रखें" रखा जाए, €5/€15/€50 की एक-बार की कीमतें और मासिक €3/€9/€25, और बुनियादी ढांचे और अगली भाषा के डेटा कार्य [H] को कवर करने के लिए €2,400 का एक ईमानदार वार्षिक लक्ष्य (सत्र लॉग, 7 सितंबर 2026)। खाता जानबूझकर dormant इस तरह से बनाया गया है — लेखक द्वारा भुगतान प्रदाता के पहचान सत्यापन को पूरा करने तक दान अक्षम कर दिया गया है — ताकि "हमेशा के लिए मुफ्त" लेखक के शब्दों में, एक verifiable claim हो, न कि एक नारा [H] (सत्र लॉग, 7 सितंबर 2026)। पहचान सत्यापन 8 सितंबर 2026 को पूरा हुआ और छह भुगतान लिंक उसी सुबह लाइव हो गए; वे स्टोर के फंडिंग अनुभाग [H] पर प्रकाशित हैं (Stripe खाता रिकॉर्ड और भुगतान-लिंक इतिहास, 8 सितंबर 2026)। सार्वजनिक-सामने वाला पाठ स्टूडियो-वॉयस नियम (फ्रंट मैटर) और ईमानदार-प्रतिलिपि नियम का पालन करता है: कोई हाइप नहीं, कोई अतिशयोक्ति नहीं — वही अनुशासन जो डेटाबेस और इस पेपर को नियंत्रित करता है।
10 · Where the project stands (7 September 2026), its honest limits, and its road ahead
10.1 Current state of the system
6–7 सितंबर 2026 [H] पर लाइव सिस्टम के खिलाफ सीधे मापा गया (सटीक क्वेरीज़ के लिए परिशिष्ट A देखें):
- Corpus (pre-repair snapshot, 6–7 September 2026): 96,434 अवधारणाएँ · 1,238,383 लेक्सिम · 1,608,018 अर्थ · 171,672 संबंध, छह जीवंत भाषाओं (अंग्रेज़ी, स्पेनिश, फ्रेंच, जर्मन, पुर्तगाली, जापानी) में — SQL की गणनाएँ दोनों मापन तिथियों पर समान रूप से दोहराई गईं।
- Corpus (post-repair, 8 September 2026): 125980 अवधारणाएँ / 125980 शब्दसमूह / 352333 अंग्रेजी शब्द-रूप, जैसा कि मरम्मत रिपोर्ट (
lm-en-coverage-REPORT-2026-09-08.txt,RESULT: PASS) में दर्ज है; cat स्टारprinceton-wordnet:02121620-nके बहुभाषी सदस्य अंग्रेजी, स्पेनिश, जापानी, जर्मन और पुर्तगाली (cat, gato, 猫, Katze, Gato doméstico) में फैले हुए हैं। - Ranking views:
concept_sky_rank94,498 पंक्तियाँ;concept_lang_rank
218,120 पंक्तियाँ; concept_word_rank 338,378 पंक्तियाँ निर्माण के समय (एक लाइव पुनर्गणना) स्टैंडर्ड डेटाबेस रोल से इनकार किया गया; [NV] को फ़्लैग किया गया।
- Performance: डिफ़ॉल्ट आकाश ≈ 0.25 s वार्म (रैंकिंग से पहले 8.6 s)
दृश्य); गहरी 1,000-तारा क्वेरी शब्दों के साथ ≈ 1.1 s (>60 s शब्दों से पहले) दृश्य); मिलीसेकंड में ग्राफ़-पथ खोजें; खोज ≈ 0.5 s वार्मअप / ≈ 10 s हार्ड डिस्क के पेज कैश पर ठंडा।
- Interface: सेमांटिक-ग्राफ़ एक्सप्लोरर API के वेब मूल पर लाइव, के साथ
सभी उपकरण (एक्सपोजर डायल, सेक्स्टेंट, स्काईमार्क्स, वर्ड कम्पास, कोर्स लॉग, एpoch स्टैम्प) 23/23 हेडलेस-ब्राउज़र एंड-टू-एंड चेक्स द्वारा सत्यापित 6–7 सितंबर 2026।
- English coverage repair: अनकैप्ड इंग्लिश WordNet पुनःआयात, संबंध, एकीकरण, दृश्य ताज़ाकरण, और एंड-टू-एंड सत्यापन श्रृंखला (अनुभाग 7.3) 7 सितंबर 2026 की सुबह लॉन्च किया गया था और 8 सितंबर 2026 को 22:19 (2026-09-08 22:19:12) पर पूरा हुआ। इसकी स्वीकृति गेट पार हो गई: श्रृंखला की अपनी रिपोर्ट (
lm-en-coverage-REPORT-2026-09-08.txt,RESULT: PASS)princeton-wordnet:02121620-nपर अवधारणा-लिंक्ड अंग्रेजी cat अर्थ को दर्ज करती है, जिसके बहुभाषी सदस्यों में cat, gato, शामिल हैं, 猫, Katze, Gato doméstico [H] (रिपोर्ट, 8 सितंबर 2026)। - Governance: दान चैनल लाइव — पहचान सत्यापन 8 सितंबर 2026 को पूरा हुआ, स्टोर में छह भुगतान लिंक प्रकाशित;
लेखक के भुगतान-प्रदाता का सत्यापन; कोडबेस का दैनिक बैकअप; ज्ञान आधार वर्तमान।
10.2 What is honestly not known, and what is unresolved
स्टूडियो की सत्यापन परंपराओं के अनुसार इस पत्र को स्पष्ट रूप से यह बताना चाहिए कि वह क्या सत्यापित नहीं कर सका, और स्रोतों के बीच विरोधाभासों को दर्ज करना चाहिए। महत्वपूर्ण बिंदु हैं:
- The "Core 6" discrepancy. लेखक का व्यक्तिगत भाषा सेट (रिकॉर्ड किया गया)
29 अगस्त 2026) स्पेनिश, अंग्रेजी, जापानी, फ्रेंच, Italian, और पुर्तगाली। लाइव डेटाबेस की छह भाषाएँ अंग्रेजी, स्पेनिश, फ्रेंच, German, पुर्तगाली और जापानी। जर्मन ने इतालवी की जगह ली। कोई मौजूदा लिखित व्याख्या के बिना डेटाबेस; इतालवी भाषा row और Italian डेटासेट पहले पंजीकृत किए गए थे लेकिन लाइव तालिका में मौजूद हैं जर्मन [H] कारण [NV] के साथ (अनुभाग 4.2 पर भी देखें) स्पेसिफिकेशन के स्तर, जिनमें मंदारिन और इतालवी शामिल थे, लेकिन जर्मन नहीं — तीन महीनों में तीन अलग-अलग प्रकाशित भाषा सेट।
- Corpus-count drift within a single day. एक तकनीकी दस्तावेज़ जो पर लिखा गया है
6 सितंबर 2026 की रिपोर्ट में 1,146,066 लेक्सिम / 1,595,537 अर्थ हैं, जबकि डायरेक्ट SQL उसी शाम रिपोर्ट 1,238,383 / 1,608,018 (अवधारणाएँ और समान संबंध: 96,434 / 171,672); उसी सत्र का लॉग शाम में एक तीसरा, मध्यवर्ती रूप होता है (≈1.15 मिलियन लेक्सीम), दिन भर अभी भी आ रहे आयातों के अनुरूप। प्रति-भाषा योग SQL आंकड़े से मेल खाता है, इसलिए दस्तावेज़ के नंबर ऐसा प्रतीत होते हैं कि वे से हैं एक अलग क्षण या फ़िल्टर; विसंगति की व्याख्या नहीं की गई है। [H] को [O] के साथ मिलान करता है। यह पेपर उद्धृत करता है। SQL अपनी तारीख के साथ आंकड़े।
- Hardware records conflict. लाइव सिस्टम को होस्ट करने वाली मशीन में
इस पेपर के लिए सितंबर 2026 को सीधे ASUS X751MA के रूप में कैप्चर किया गया था। इंटेल Pentium N3540 (बे-ट्रेल), 8 जीबी रैम (अनुभाग 9.1) के साथ [H]। लिखित अभिलेख और भी अव्यवस्थित है: परियोजना नोट्स बॉक्स का वर्णन करते हैं। इंटेल एटम बे-ट्रेल (Z36xx/Z37xx) और पेंटियम N3540 के रूप में — एक ही सिलिकॉन पीढ़ी दो मार्केटिंग नामों [O] के तहत — जबकि पहले 2026 वार्तालाप रिकॉर्ड एक अलग मशीन, एक इंटेल का संदर्भ देते हैं। Jasper Lake "N5105" 12 GB रैम के साथ (जनवरी 2026) और बाद में के रूप में "एक जैस्पर लेक 4 चिप" (मई 2026) और "इंटेल जैस्पर लेक N5105, 4 जीबी" (2026 के मध्य की मेमोरी फ़ाइल)। जैस्पर लेक बे-ट्रेल सिलिकॉन नहीं है, इसलिए रिकॉर्ड या तो वर्ष भर दो अलग-अलग मशीनों का वर्णन करते हैं या सहायक गलत लेबलिंग; बचे हुए साक्ष्य यह तय नहीं कर सकते कि कौन सा है, और बिंदु को यहाँ उजागर किया गया है, बजाय इसके कि इसे [H] के साथ सहज कर दिया जाए। समझौता [NV] (सत्र लॉग और एआई-संवाद रिकॉर्ड, जनवरी–सितंबर 2026
- Data-quality warnings from the September audit: कॉर्पस में शामिल है
178,576 डुप्लिकेट लेम्मा जोड़े; 124,790 ऐसे लेक्सिम जिनका कोई अर्थ नहीं; 33.9% के परिभाषाएँ खाली; और (अंग्रेजी मरम्मत से पहले) 71.7% अर्थ अभी तक नहीं अवधारणाओं से जुड़ा हुआ। उसी ऑडिट में पाया गया कि संदर्भात्मक अखंडता बनी हुई थी। पूरी तरह से (योग सटीक, डेटाबेस स्तर पर कोई लटकती/अनाथ पंक्तियाँ नहीं): 71.7% का आँकड़ा not yet linked to a concept इंद्रियों का वर्णन करता है, डिज़ाइन किया गया दृश्यमान अनाथ अवस्था, टूटे संदर्भ नहीं — एक ईमानदार परियोजना संरेखण कार्य के दौरान जानबूझकर दिखाई देती रहती है। [H] जारी है (ऑडिट, 5–6 सितंबर 2026)।
- आलू के अलावा अन्य हार्डवेयर पर Unmeasured or pending: का प्रदर्शन
कभी मापा नहीं गया है; परियोजना के अभी तक कोई सार्वजनिक उपयोगकर्ता नहीं हैं, इसलिए हैं कोई वास्तविक-उपयोग मेट्रिक्स नहीं; स्टूडियो की कानूनी संरचना दस्तावेजीकृत नहीं है। रिकॉर्ड्स; "दोनों कोरिया" मॉडलिंग प्रश्न, कैंटोनीज़ डेटा की कमी, और ताइवान के वर्डनेट लाइसेंसिंग की समीक्षा खुली हैं (अनुभाग 10.3)।
10.3 The road ahead
रोडमैप, जिसे 29 अगस्त 2026 को उपयोगकर्ता द्वारा अनुमोदित किया गया था, जून पांडुलिपि के सात ग्राफ़ [H] (परियोजना नोट) का परिपक्व रूप है: ध्वनि विज्ञान/ध्वनिशास्त्र, रूप विज्ञान (आयातित), वाक्य रचना (आयातित), अर्थ विज्ञान (आयातित), शब्दकोश निर्माण (आयातित), कॉर्पस (आयातित), और — कतारबद्ध — संवाद, व्युत्पत्ति, और पत्राचार और उपयोग की परतें, साथ ही भविष्य का सार्वजनिक वेब इंटरफ़ेस। निकट भविष्य में प्रलेखित योजनाएँ [H] (सत्र लॉग, 7 सितंबर 2026) हैं:
- The CJKV family. स्कीमा के लिए नियोजित अगली भाषाएँ हैं
मैंडारिन (cmn), कैंटोनीज़ (yue), कोरियाई (kor), और वियतनामी (vie)। उनके समय-सारणी ईमानदार डेटा-उपलब्धता टोही पर निर्भर करती है। ओपन-डेटा परिदृश्य क्या प्रदान करता है, इस बारे में: OMW Wiktionary वर्डनेट्स मौजूद हैं मैंडारिन (19,079 पंक्तियाँ), कैंटोनीज़ (527), कोरियाई (9,268), और वियतनामी (5,498); मैंडरिन (123k टोकन) और कैंटोनीज़ के लिए यूडी ट्रीबैंक्स (14k), कोरियाई (80k GSD प्लस 350k KAIST), वियतनामी (58k)। कैंटोनीज़ है दुर्लभ — कोई बड़ा वर्डनेट नहीं, छोटा ट्रीबैंक — और ताइवानवासी वर्डनेट लाइसेंस समीक्षा के अधीन हैं [H] (सत्र लॉग और डेटा) इन्वेंटरी, 7 सितंबर 2026)। कोई भी CJKV डेटासेट इसमें आयात नहीं किया गया है। इस मसौदे के अनुसार वर्तमान कोष; परिवार का समय निर्धारण एक खुला निर्णय है। उस समीक्षा का इंतज़ार है।
- Research-v1 interface panes (वर्ड लेंस, लीनियर क्लाइम्ब, फील्ड कार्ड्स,
(नोटबुक, तुलना तालिका) 6 को डिज़ाइन और बैकएंड-अनुमोदित किए गए थे। सितंबर 2026 और इंस्ट्रूमेंट बिल्ड [H] के पीछे कतार में।
- Publication. यह पेपर एक प्रारंभिक एआई-जनित मसौदा है;
मानव-रचित प्रकाशन विकास के अधीन है (प्रारंभिक भाग)।
- Languages without end. स्कीमा का वादा — एक भाषा के रूप में जोड़ें
रो प्लस डेटासेट्स — परियोजना का घोषित दीर्घकालिक लक्ष्य है, और दान का प्रस्ताव स्पष्ट रूप से कहता है: Lingua Mundi छह भाषाओं से शुरू होता है, उन्हें अनिश्चितकाल तक जोड़ने के लिए बनाया गया [H] (सत्र लॉग, 7 सितंबर 2026)।
10.4 Conclusion
3 दिसंबर 2025 को मुफ़्त शब्दकोश फ़ाइलों के अनुरोध के रूप में जो शुरू हुआ था, वह अब मुफ़्त टूल और 2014 के लैपटॉप का उपयोग करके एक व्यक्ति द्वारा ओपन डेटा पर बनाया गया, चलने वाला, खोजने योग्य, छह-भाषाओं का अर्थ-मानचित्र है। इसे आगे बढ़ाने वाले विचार — कि बहुभाषी डेटा की स्वाभाविक इकाई अर्थ है; कि संरेखण स्पष्ट और लेबल किया हुआ होना चाहिए, कभी भी चुपचाप अनुमानित नहीं; कि महँगी गणना एक बार तैयार किया जाना चाहिए और कई बार पढ़ा जाना चाहिए; कि बजट की सीमा एक डिज़ाइन टूल है; कि किसी डेटाबेस या पेपर में हर दावे के साथ उसका स्रोत और तारीख जुड़ी होनी चाहिए — ये विचार नए नहीं हैं, लेकिन वे true हैं, और यह परियोजना यह प्रदर्शित करती है कि एक व्यक्ति उन पर अमल कर सकता है। इसका सबसे मूल्यवान अवशेष शायद डेटाबेस बिल्कुल भी नहीं है, बल्कि यह प्रदर्शन है कि एक अकेला शोधकर्ता सार्वजनिक रूप से ईमानदार बुनियादी ढांचा बना सकता है: जो वह मापता है उसे मापना, जिसे वह दिनांकित करता है उसे दिनांकित करना, अपने अनाथों को दिखाना, और अपने वचन का पालन करना — एक सितारा, छह भाषाएँ, और पूरा आसमान अभी भी आगे है।
Built in a cave, with a bunch of scraps.
References
एपीए 7वां संस्करण। ग्रंथसूची संबंधी विवरणों का सत्यापन 7 सितंबर 2026 को प्रकाशक के पृष्ठों और डिजिटल-ऑब्जेक्ट-आईडेंटिफ़ायर रिकॉर्ड के विरुद्ध किया गया। सॉफ़्टवेयर और डेटा स्रोतों का हवाला एपीए के सॉफ़्टवेयर/डेटा-सेट प्रारूपों के अनुसार दिया गया है। (केवल पाठ में उद्धृत कृतियों की सूची दी गई है।)
बॉन्ड, एफ., और फोस्टर, आर. (2013). एक खुले बहुभाषी वर्डनेट को जोड़ना और उसका विस्तार करना। प्रोसीडिंग्स ऑफ़ द 51st एनुअल मीटिंग ऑफ़ द एसोसिएशन फॉर कंप्यूटेशनल लिंग्विस्टिक्स (पृ. 1352–1362) में। एसोसिएशन फॉर कंप्यूटेशनल लिंग्विस्टिक्स। https://aclanthology.org/P13-1133/
ब्रेल इंस्टीट्यूट ऑफ अमेरिका। (2019). Atkinson Hyperlegible [कंप्यूटर फ़ॉन्ट]. https://brailleinstitute.org/freefont
ब्रीन, जे. डब्ल्यू. (2004). JMdict: एक जापानी-बहुभाषी शब्दकोश। बहुभाषी भाषाई संसाधनों पर कार्यशाला (COLING 2004) की कार्यवाही (पृ. 65–72) में। COLING। https://aclanthology.org/W04-2209/
इलेक्ट्रॉनिक डिक्शनरी अनुसंधान और विकास समूह। (तिथिहीन)। JMdict / EDICT जापानी–अंग्रेजी शब्दकोश परियोजना [डेटा फ़ाइलें और दस्तावेज़ीकरण]। 7 सितंबर, 2026 को https://www.edrdg.org/jmdict/edict_doc.html से प्राप्त।
फेल्बॉम, सी. (सं.). (1998). WordNet: An electronic lexical database. एमआईटी प्रेस. https://mitpress.mit.edu/9780262561167/wordnet/
गाइया सहयोग, ब्राउन, ए. जी. ए., वल्लेनारी, ए., प्रुस्ती, टी., डी ब्रुइन, जे. एच. जे., बाबुसियो, सी., … ज़्विटर, टी. (2018). गाइया डेटा रिलीज़ 2: सामग्री और सर्वेक्षण गुणों का सारांश। Astronomy & Astrophysics, 616, लेख A1। https://doi.org/10.1051/0004-6361/201833051
हर्नांडेज़, आर. (2026, 1 जून)। Lingua Mundi: अवधारणा-आधारित भाषा मॉडल के लिए एक अर्थगत अवसंरचना (संस्करण 1–7) [अप्रकाशित पांडुलिपि; संशोधन और लेखापरीक्षा रिकॉर्ड लेखक के संवाद-लॉग अभिलेखागार में संरक्षित हैं]।
हर्नांडेज़, आर. (२०२६, २४ जुलाई). बहुभाषी शब्दावली मंच — इंजीनियरिंग विनिर्देश (संस्करण २.०) [अप्रकाशित विनिर्देश दस्तावेज़; पाठ फ़ाइल पर निकाला गया]।
किरोव, सी., कॉटरल, आर., सिलक-ग्लासमैन, जे., वाल्थर, जी., विलोमोवा, ई., शिया, पी., फ़ारूकी, एम., मील्के, एस. जे., मैकार्थी, ए., कुब्लेर, एस., यारोस्की, डी., आइसनर, जे., और हुल्डेन, एम. (2018). UniMorph 2.0: सार्वभौमिक रूप-विज्ञान। में प्रोसीडिंग्स ऑफ़ द इलेवन्थ इंटरनेशनल कॉन्फ्रेंस ऑन लैंग्वेज रिसोर्सेज़ एंड इवैल्यूएशन (LREC 2018)। यूरोपियन लैंग्वेज रिसोर्सेज़ एसोसिएशन। https://aclanthology.org/L18-1293/
मैककार्थी, ए. डी., किरोव, सी., ग्रीला, एम., निधि, ए., शिया, पी., गोरमैन, के., विलोमोवा, ई., मेल्के, एस. जे., निकोलाई, जी., सिल्वरबर्ग, एम., अर्खांगेल्स्की, टी., क्रिज़ानोव्स्की, एन., क्रिज़ानोव्स्की, ए., क्ल्याचको, ई., सोरोकिन, ए., मैन्सफील्ड, जे., अर्न्शट्राइट्स, वी., पिंटर, वाई., जैकब्स, सी. एल., … यारोस्की, डी. (2020). UniMorph 3.0: यूनिवर्सल मॉर्फोलॉजी। प्रोसीडिंग्स ऑफ द ट्वेल्फ्थ इंटरनेशनल कॉन्फ्रेंस ऑन लैंग्वेज रिसोर्सेज एंड इवैल्यूएशन (LREC 2020) में (पृ. 3922–3931)। यूरोपियन लैंग्वेज रिसोर्सेज एसोसिएशन। https://aclanthology.org/2020.lrec-1.483/
मेयर, सी. एम., और गुरेविच, आई. (2012). Wiktionary: विशेषज्ञ-निर्मित शब्दकोशों के लिए एक नया प्रतिद्वंद्वी? सहयोगात्मक शब्दकोश-लेखन की संभावनाओं की खोज। एस. ग्रेनजर और एम. पाक्वोट (संपादक), Electronic lexicography (पृ. 259–292)। ऑक्सफ़ोर्ड यूनिवर्सिटी प्रेस। https://doi.org/10.1093/acprof:oso/9780199654864.003.0013
मिलर, जी. ए. (1995). WordNet: अंग्रेज़ी के लिए एक शब्दावली डेटाबेस। Communications of the ACM, 38(11), 39–41. https://doi.org/10.1145/219717.219748
निव्रे, जे., डी मार्नेफे, एम.-सी., गिनटर, एफ., हाजिक, जे., मैनिंग, सी. डी., प्यसालो, एस., शस्टर, एस., टायर्स, एफ., और ज़ेमन, डी. (2020). यूनिवर्सल डिपेंडेंसीज़ v2: एक लगातार बढ़ता हुआ बहुभाषी ट्रीबैंक संग्रह। में प्रोसीडिंग्स ऑफ द ट्वेल्थ इंटरनेशनल कॉन्फ्रेंस ऑन लैंग्वेज रिसोर्सेज एंड इवैल्यूएशन (LREC 2020) (पृ. 4034–4043)। यूरोपियन लैंग्वेज रिसोर्सेज एसोसिएशन। https://aclanthology.org/2020.lrec-1.497/
प्रिंसटन विश्वविद्यालय। (तारीख नहीं दी गई)। About WordNet। WordNet। 7 सितंबर, 2026 को https://wordnet.princeton.edu/ से प्राप्त।
एसआईएल इंटरनेशनल। (त.अ.). ISO 639-3। 7 सितंबर, 2026 को https://iso639-3.sil.org/ से प्राप्त।
दे सोस्यूर, एफ. (1983). Course in general linguistics (सी. बैली, ए. सेशेहे, और ए. रीडलिंगर, संपा.; आर. हैरिस, अनु.); डकवर्थ। https://www.bloomsbury.com/us/course-in-general-linguistics-9781472508829/ (मूल कृति 1916 में प्रकाशित)
स्पीयर, आर. (2022). वर्डफ्रीक्: कई भाषाओं में शब्दों की आवृत्ति का एक डेटाबेस (संस्करण 3.0) [कंप्यूटर सॉफ्टवेयर]. GitHub. https://github.com/rspeer/wordfreq
टिडेमैन, जे. (2012). OPUS में समानांतर डेटा, उपकरण और इंटरफ़ेस। में भाषा संसाधन और मूल्यांकन पर आठवीं अंतर्राष्ट्रीय सम्मेलन की कार्यवाही (LREC 2012) (पृ. 2214–2218)। यूरोपीय भाषा संसाधन संघ। https://aclanthology.org/L12-1246/
Vrandečić, D., & Krötzsch, M. (2014). Wikidata: एक मुक्त सहयोगात्मक ज्ञानकोश। Communications of the ACM, 57(10), 78–85। https://doi.org/10.1145/2629489
विकिमीडिया फाउंडेशन। (त.अ.). Wiktionary: The free dictionary। 7 सितंबर, 2026 को https://www.wiktionary.org/ से प्राप्त।
Zipf, जी. के. (1949). Human behavior and the principle of least effort. एडिसन-वेस्ले प्रेस. https://archive.org/details/humanbehaviorpri0000zipf
Appendix A · Sources, method, and verification
A.1 The annotation convention
स्टूडियो के कठोर मानक (जो इसके अन्वेषणात्मक कार्य से विरासत में मिला है) का पालन करते हुए, इस पत्र में दावों को टैग किया गया है जहाँ पाठक को उनके ज्ञान संबंधी स्थिति को जानने की आवश्यकता होती है: [H] = सत्यापित तथ्य — एक माप, कोड, या दिनांकित स्रोत जिसका इस पत्र के लिए संदर्भ लिया गया है; [O] = श्रेयित व्याख्या या राय; [NV] = सत्यापित नहीं / नहीं मिला। सार और मुख्य भाग में प्रत्येक आकृति या तो अपनी तारीख के साथ एक [H] माप है या उस पर लेबल लगा है।
A.2 Source families consulted (access 6–7 September 2026)
| # | Source | What it provided |
|---|---|---|
| 1 | Live codebase: …/SafeMode/Software Development/LinguaMundi/lingua-mundi (api/, core/, schemas/, importers/, scripts/, docs/, gui/) | Architecture, schema, importers, materialized-view SQL, API routes, GUI code |
| 2 | Live database lingua_mundi (PostgreSQL, 127.0.0.1:5433), direct SQL | Corpus counts, language table, synset membership, concept links |
| 3 | Live API (127.0.0.1:8765): /languages, /graph/sky, /graph/star, /graph/word, /graph/path, /openapi.json | Endpoint behavior, warm/cold latencies, gzip |
| 4 | Web interface (127.0.0.1:8765/gui) + headless-browser checks | UI behavior; 23/23 end-to-end checks recorded 6–7 Sep 2026 |
| 5 | Vault knowledge base (session logs 26 Aug–7 Sep 2026, handoffs, project notes, conventions) | Milestones, decisions, quotes, conventions, dates |
| 6 | ChatGPT conversation archive (export 5 Sep 2026; 421 conversations with content) | Origin and growth conversations, verbatim quotes (Section 1, 3, 4) |
| 7 | DeepSeek data export (6 Sep 2026; 215 conversations) | June 2026 manuscript revision cycle, setup logs |
| 8 | Claude.ai data export (extracted 6 Sep 2026; legacy-memory file updated 7 Sep 2026) | Long-horizon context, project roles |
| 9 | Personal artifacts in the author's home directory (file timestamps, scripts, specification PDF, journals) | Pre-project chronology (Nov–Dec 2025), engineering specification, journals |
| 10 | Published scholarly and data sources (see References) | Background and related work |
प्रतिनिधि सत्यापन क्वेरी (7 सितंबर 2026 को चलाया गया, भूमिका lingua): SELECT count(*) FROM concept|lexeme|sense|relation → 96,434 / 1,238,383 / 1,608,018 / 171,672; SELECT code FROM language → deu, eng, fra, jpn, por, spa; प्रत्येक भाषा के अनुसार सिनसेट 02121620-n की सदस्यता (अनुभाग 8.5); परियोजना की अपनी स्वीकृति स्क्रिप्ट verify-lm-cat-demo.sh (अनुभाग 7)।
A.3 Key numbers with dates (compressed timeline)
| Date | Event / figure |
|---|---|
| 2025-11-11 | KANJIDIC2 downloaded (first dataset, file timestamp) |
| 2025-12-03 | Origin message: "unified multilingual database" (ChatGPT log) |
| 2025-12-05 | OMW data downloaded; first extract scripts |
| 2025-12-08…16 | Merge/unified pipeline; four-entity (concept/sense/lexeme/grapheme) JSONL schema |
| 2026-05-01 | OMW v2.0 coverage study |
| 2026-05-23 | "Multilingual Lexical Platform" spec master (markdown) |
| 2026-06-01 | Lingua Mundi named; manuscript V1–V7 revision cycle (DeepSeek + ChatGPT audits) |
| 2026-07-17/18 | Code scaffolding; feasibility conversation; journal |
| 2026-07-24 | Engineering Specification V2 (104 pp., PDF) |
| 2026-08-13 | Lean-stack decision; semantic interaction layer |
| 2026-08-19…25 | Japanese demo builds; 23 Aug concept descriptions |
| 2026-08-27 | Daily GitHub backups begin |
| 2026-08-29 | "LinguaMundi IS the lexicon" decision; roadmap approved; Core 6; Postgres live; UD importer |
| 2026-08-30 | API routes (CORS, /lookup, /kanji); 27 tests green; first /gui deploy |
| 2026-08-31 | Import restart (~1.13M rows); English OMW cap seeded the cat bug |
| 2026-09-01 | Planetarium naming; ≈1.54M rows; store live |
| 2026-09-05 | Deep audit; pagination fixes; 1,238,383 lexemes |
| 2026-09-06 | Enrichment audit; materialized-view overhaul (94,498 / 218,120); words bake (338,378); GUI pivot to semantic-graph explorer; cat root cause; research-v1 approval |
| 2026-09-07 | Instruments live (23/23 E2E); donation setup (dormant); English coverage repair chain launched; CJKV data-availability reconnaissance; this paper drafted |
| 2026-09-08 | English coverage repair verified complete (8 September 2026 at 22:19); acceptance gate PASS recorded in lm-en-coverage-REPORT-2026-09-08.txt |
A.4 Contradictions and unresolved items
जैसा कि अनुभाग 10.2 में प्रलेखित है: इतालवी/जर्मन कोर-6 विसंगति; एक ही दिन के कॉर्पस-गिनती में उतार-चढ़ाव (डॉसियर 1,146,066 बनाम SQL 1,238,383 लेक्सिम, साथ ही उसी शाम के सत्र लॉग में एक तीसरा मध्यवर्ती आंकड़ा, SQL आंकड़े के साथ प्रति-भाषा सुलझाया गया); हार्डवेयर रिकॉर्ड्स में असंगति (एटम बे-ट्रेल बनाम पेंटियम N3540 बनाम 2026 के शुरुआती रिकॉर्ड्स में एक जैस्पर लेक N5105 — धारा 10.2 आइटम 3); 71.7%-अनलिंक्ड-सेंस और अन्य डेटा-गुणवत्ता चेतावनियाँ; और अप्रमाणित/अपुष्टित आइटम: 26 अगस्त से पहले की सटीक रिपो स्थापना तिथि, भाषा-सेट परिवर्तन का कारण, 1-जून ऑडिट पाठों की मॉडल उत्पत्ति (ऑडिट लेखक की उपयोगकर्ता पक्ष की ChatGPT बातचीत में मौजूद हैं; कौन सा सहायक मॉडल किसने कौन सा ऑडिट दौर लिखा, यह निर्यात में स्वतंत्र रूप से प्रमाणीकृत नहीं है — देखें अनुभाग 3.3), concept_word_rank लाइव पुनर्गणना (अनुमति-अस्वीकृत), और स्टूडियो की कानूनी संरचना।
A.5 Methodology notes
- परीक्षण के अधीन प्रणाली is उत्पादन प्रणाली है; वार्म माप लेता है।
±0.3 सेकंड हार्ड-डिस्क शोर; दिनांक और समय रिकॉर्ड्स के अपने अनुसार दिए गए हैं। समय क्षेत्र (जब तक अन्यथा उल्लेख न हो, केंद्रीय समय; DeepSeek लॉग्स +08:00 का उपयोग करते हैं और थे) परिवर्तित किया गया।
- उद्धरण उद्धृत लॉग/फाइलों से शब्दशः लिए गए हैं; त्रिपुटियाँ कटौती को दर्शाती हैं;
स्पेनिश उद्धरणों को जहाँ भी उपयोग किया गया है, मुख्य पाठ में अंग्रेजी व्याख्याओं के साथ दिया गया है।
- यह पेपर स्वयं एक एआई-जनित मसौदा (प्रारंभिक सामग्री सूचना) है; यह था
लेखक के निर्देशन में उपरोक्त स्रोतों से लिखा गया है और नहीं किया गया है। सहकर्मी समीक्षा की गई है। सत्यापन उपकरण: सीधी SQL, HTTP क्वेरीज़, हेडलेस-ब्राउज़र जांचें, और स्रोत-फ़ाइल पढ़ना; कोई दावा भरा नहीं गया था। स्रोत के अस्तित्व में होने पर स्मृति।
Appendix B · Glossary — plain-language terms used in this paper
How to use this glossary: the first time a technical term appears in the paper it is underlined with dots — hover it (or tap it) for a quick definition, or click it to jump here. This list is alphabetical.
- Alignment — एक भाषा के शब्द का दूसरे भाषा के शब्द के समान अर्थ होने का निर्णय लेने की क्रिया।
- API — एक इंटरफ़ेस जो एक प्रोग्राम को दूसरे से डेटा मांगने की अनुमति देता है (उदाहरण के लिए, एक शब्दकोश ऐप जो Lingua Mundi डेटाबेस से किसी शब्द के लिए पूछता है)।
- Autonym — वह नाम जो उस भाषा के अपने वक्ता इसे कहते हैं (स्पेनिश वक्ता स्पेनिश को español कहते हैं)।
- Bake — इस परियोजना का शब्द है महँगे उत्तर की गणना एक बार करने, उसे संग्रहीत करने, और कई बार पढ़ने के लिए (काम करने का नियम है "bake, don't re-derive")।
- Breadth-first search — दो बिंदुओं के बीच सबसे छोटा मार्ग खोजने के लिए, एक पत्थर से पड़ने वाली लहरों की तरह परतों में ग्राफ़ को बाहर की ओर अन्वेषण करने का एक तरीका।
- CJKV — चीनी, जापानी, कोरियाई और वियतनामी लिपियों के परिवार के लिए एक संक्षिप्त नाम (ये अक्षर इन लिपियों के नामों का प्रतिनिधित्व करते हैं)।
- Concept — एक अर्थ, जो विभिन्न भाषाओं में साझा है (इस पेपर में, "घरेलू बिल्ली की अवधारणा," न कि कोई विशेष शब्द)।
- Corpus — भाषा डेटा (पाठ या शब्दकोश प्रविष्टियाँ) का एक बड़ा संग्रह जो साक्ष्य के रूप में उपयोग किया जाता है।
- Dataset — एक स्रोत से डेटा का एक पैकेज्ड संग्रह, जिसका अपना प्रारूप और लाइसेंस है।
- Derivation / etymology — व्युत्पत्ति वह प्रक्रिया है जिससे नए शब्द मौजूदा शब्दों से बनाए जाते हैं (run → runner); शब्द-इतिहास किसी शब्द का समय और भाषाओं के पार का इतिहास है।
- ETL — एक्सट्रैक्ट-ट्रांसफॉर्म-लोड: बाहरी स्रोत से डेटा पढ़ने, उसे पुनःआकार देने और डेटाबेस में संग्रहीत करने की प्रक्रिया।
- FastAPI — इस परियोजना द्वारा प्रदान किए जाने वाले प्रकार के इंटरफ़ेस (API) को बनाने के लिए एक मुफ्त, ओपन-सोर्स पाइथन फ्रेमवर्क।
- Full-text search — सटीक पहचानकर्ताओं के बजाय संग्रहीत पाठ में मेल खाने वाले शब्दों के आधार पर डेटाबेस में खोज करना।
- Grapheme — एक लिखित अक्षर: वर्णमाला का एक अक्षर, एक अक्षर चिह्न, या एक कांजी।
- Graph — इस पेपर में, टाइप किए गए संबंधों (एज) द्वारा जुड़े अर्थों (नोड्स) का एक समूह।
- Gzip — एक मानक संपीड़न विधि जो फ़ाइलों को इंटरनेट पर भेजे जाने से पहले छोटा बनाती है।
- HTTP — वह प्रोटोकॉल है जिसका उपयोग वेब ब्राउज़र और एपीआई इंटरनेट पर डेटा मांगने और प्राप्त करने के लिए करते हैं।
- Hypernym / taxonomy — हाइपरनйм = "एक प्रकार का": feline, domestic cat का हाइपरनйм है। एक वर्गीकरण प्रणाली इन प्रकारों का परिणामी वृक्ष है।
- Importer — एक प्रोग्राम जो एक बाहरी डेटासेट को पढ़ना और उसे Lingua Mundi की अपनी स्कीमा में लिखना जानता है।
- Index — एक डेटाबेस संरचना जो क्वेरीज़ को पंक्तियाँ तेज़ी से खोजने की अनुमति देती है, जैसे कि किसी किताब के हर पृष्ठ को पढ़ने के बजाय उसकी अनुक्रमणिका का उपयोग करना।
- Inflection / morphology — इन्फलेक्शन किसी शब्द के रूप को व्याकरण के अनुसार बदलना है (run → ran); मॉर्फोलॉजी उन रूपों का अध्ययन है।
- Instance-of / part-of — ग्राफ़ में दो संबंध प्रकार: "यह उस का एक उदाहरण है" (एक बिल्ली स्तनधारी-प्रजाति का उदाहरण है) और "यह उस का एक हिस्सा है" (एक पंजा बिल्ली का हिस्सा है)।
- Interlingua — भाषाओं के बीच एक साझा मध्य प्रतिनिधित्व: स्पेनिश को सीधे अंग्रेज़ी में अनुवाद करने के बजाय, स्पेनिश→अर्थ→अंग्रेज़ी का मार्ग अपनाएँ।
- ISO 639-3 — प्रत्येक मानव भाषा को एक अनूठा तीन-अक्षरों का कोड (
spa= स्पेनिश,jpn= जापानी) आवंटित करने वाला अंतर्राष्ट्रीय मानक। - JMdict / KANJIDIC2 — JMdict एक बड़ी जापानी–बहुभाषी शब्दकोश है; KANJIDIC2 इसकी साथी फ़ाइल है जिसमें कंजी (जापानी में प्रयुक्त चीनी अक्षर) के उच्चारण और अर्थ दिए गए हैं।
- JSON Lines — एक सरल टेक्स्ट प्रारूप जहाँ प्रत्येक पंक्ति एक डेटा रिकॉर्ड होती है, जो परियोजना की सबसे शुरुआती पाइपलाइन फ़ाइलों के लिए उपयोग किया जाता था।
- Kaikki — Wiktionary डेटा का मशीन-पठनीय निष्कर्षण, जो मूल पृष्ठों की तुलना में प्रोग्रामों के लिए पढ़ने में आसान है।
- Kanji — लिखित जापानी में प्रयुक्त चीनी मूल के अक्षर।
- Lemma — किसी शब्द का शब्दकोश रूप (वह रूप जिसे आप खोजते हैं: cat, cats नहीं; run, ran नहीं)।
- Lexeme — एक विशिष्ट भाषा में एक शब्द रूप (स्ट्रिंग cat)।
- License — कानूनी शर्तें जो बताती हैं कि डेटा का उपयोग और साझा कैसे किया जा सकता है; "ओपन" लाइसेंस श्रेय देने पर पुन: उपयोग की अनुमति देते हैं (जैसे CC BY-SA)।
- Long tail — ज़िप्फ़ियन वितरण के दूरस्थ छोर पर स्थित दुर्लभ वस्तुओं का विशाल द्रव्यमान (देखें Zipf का नियम)।
- Materialized view — एक संग्रहीत, पूर्व-गणना किया गया प्रश्न परिणाम, जिसे एक अनुसूची के अनुसार ताज़ा किया जाता है, ताकि दोहराए गए प्रश्नों में काम दोबारा न करना पड़े (बेक पैटर्न)।
- Morphology — शब्द रूपों का अध्ययन और वे व्याकरण के लिए कैसे बदलते हैं (देखें: इन्फलेक्शन)।
- Natural language — मानव भाषा, जैसा कि लोग वास्तव में बोलते और लिखते हैं, प्रोग्रामिंग भाषाओं के विपरीत।
- Node / edge — एक ग्राफ़ में, एक नोड एक आइटम (यहाँ, एक अवधारणा) होता है और एक एज दो आइटमों के बीच का संबंध (यहाँ, एक प्रकारबद्ध संबंध) होता है।
- OMW / Open Multilingual Wordnet — अंग्रेज़ी WordNet के अनुरूप वर्डनेट्स का संग्रह।
- OPUS — वेब और फिल्म उपशीर्षकों से एकत्रित अनुवादित वाक्यों का एक बड़ा संग्रह।
- Orphan sense — एक शब्दकोश अर्थ जो अभी तक किसी साझा अवधारणा से जुड़ा नहीं है; छिपाने के बजाय दिखाया गया।
- Pagination — एक लंबी परिणामों की सूची को एक साथ भेजने के बजाय क्रमांकित पृष्ठों में विभाजित करना।
- Part of speech — किसी शब्द की व्याकरणिक श्रेणी: संज्ञा, क्रिया, विशेषण, आदि।
- Pipeline — प्रोग्रामों की एक श्रृंखला जो कच्चे स्रोत से डेटा को सफाई के चरणों से होते हुए उसके अंतिम गंतव्य तक पहुँचाती है।
- Plugin / registry — एक प्लगइन एक डेटासेट के लिए एक छोटा ऐड-ऑन प्रोग्राम है; रजिस्ट्री उन सभी की एकमात्र आधिकारिक सूची है।
- Polysemy — एक शब्द जिसके कई अर्थ हैं (bank: नदी का किनारा / धन का किनारा).
- PostgreSQL — एक मुफ्त, ओपन-सोर्स रिलेशनल डेटाबेस (जिसमें सिस्टम Lingua Mundi सब कुछ संग्रहीत करता है)।
- Relation — दो अवधारणाओं (घरेलू बिल्ली is a फेलिन) के बीच एक टाइप किया गया, निर्देशित संबंध।
- Schema — एक डेटाबेस का ब्लूप्रिंट: कौन-कौन सी तालिकाएँ मौजूद हैं, प्रत्येक पंक्ति में क्या है, और तालिकाएँ एक-दूसरे का संदर्भ कैसे देती हैं।
- Sense — एक शब्द का एक अर्थ, जैसा कि एक शब्दकोश में दर्ज है।
- Signifier / signified — सॉस्यूर के अनुसार एक शब्द के दो पहलू: इसकी ध्वनि या रूप (संकेतक) और वह अवधारणा जिसे यह इंगित करता है (संकेतित)।
- Sky brightness / magnitude — किसी अर्थ की "महत्वपूर्णता" की परियोजना द्वारा दी गई रैंकिंग, जो इस बात पर आधारित है कि कितनी भाषाएँ और शब्द उससे जुड़े हैं।
- SQL — रिलेशनल डेटाबेस से प्रश्न पूछने के लिए मानक भाषा।
- Synset — शब्दों का एक समूह जो कुछ संदर्भों में एक ही अर्थ व्यक्त कर सकता है; Lingua Mundi में, एक सिनसेट का अर्थ एक अवधारणा के रूप में संग्रहीत किया जाता है।
- Token — मशीन लर्निंग में, टेक्स्ट का छोटा सा हिस्सा (अक्सर एक शब्द या शब्द का हिस्सा) जिसे एक मॉडल पढ़ता या लिखता है।
- Treebank — वास्तविक वाक्यों का एक संग्रह, जिन्हें उनकी व्याकरण के साथ चिह्नित किया गया है (कि कौन सा शब्द कौन सी भूमिका निभाता है)।
- UD / Universal Dependencies — एक सामुदायिक परियोजना जो कई भाषाओं में व्याकरण संबंधी टिप्पणीयुक्त वाक्य डेटा को खुले लाइसेंस के तहत प्रकाशित करती है।
- UniMorph — शब्द-रूप (विकरण संबंधी) डेटा का एक बहुभाषी भंडार।
- URI — किसी वस्तु के लिए एक स्थिर, अद्वितीय पता, यहाँ अवधारणाओं के लिए उपयोग किया गया है (उदाहरण के लिए, घरेलू बिल्ली के लिए
princeton-wordnet:02121620-n)। - Wikidata — CC0 के तहत जारी, मशीन-पठनीय पहचानकर्ताओं के साथ विधानात्मक वाक्यों का विकिमीडिया का संरचित ज्ञान आधार।
- Wiktionary — विकिमीडिया फाउंडेशन द्वारा होस्ट की गई सहयोगात्मक शब्दकोश।
- Word form — एक भाषा में किसी शब्द की एक वर्तनी; देखें लेक्सिम।
- WordNet — मूल अंग्रेज़ी अर्थ-आधारित शब्दावली डेटाबेस (प्रिंसटन); OMW अन्य भाषाओं को इससे संरेखित करता है।
- Wordfreq — विभिन्न भाषाओं में शब्दों की आवृत्ति सूचियों का एक डेटाबेस, जिसका उपयोग शब्दों की सामान्यता के आधार पर उन्हें रैंक करने के लिए किया जाता है।
- Writing script — एक भाषा में लिखे जाने वाले वर्णों का समूह (लैटिन, अरबी, चीनी वर्ण, आदि)।
- Zipf's law — यह अवलोकन कि कुछ ही शब्द अधिकांश उपयोग के लिए जिम्मेदार होते हैं और दुर्लभ शब्दों की लंबी पूंछ शेष के लिए जिम्मेदार होती है।