Lingua Mundi: Building a Language-Agnostic Map of Meaning from Open Lexical Data

One idea in every language, on one star.

A project history and technical account · 初步人工智能生成草稿 · RHLS 工作室 · 2026年9月7日

RHLS 商店 · Lingua Mundi · 博客 · 英文音頻 · English · Español · Français · Deutsch · Italiano · Português · 日本語 · 한국어 · 简体中文 · 繁體中文 · 廣東話 · हिन्दी · العربية


Notice — preliminary AI-generated draft. This document was drafted by an artificial-intelligence research agent (operating inside the RHLS "DeepSeek Harness" toolchain) at the direction of Raciel Hernández Hernández, the project's author. It is not the final publication: the authoritative, human-authored paper is still in development by Mr. Hernández. Every fact, figure, and quotation in this draft traces to a dated primary source (conversation logs with ChatGPT, Claude, and DeepSeek; project journals and session logs; the software repository and its documentation; and direct measurements of the live database and application programming interface), and the sources are listed in the appendix. Statements that could not be verified are explicitly marked. No claim in this draft should be treated as peer-reviewed or as final wording.

How to read this paper. 佢係寫畀 not 嘅人 計算語言學家同 not 程式設計師。第一次係技術性嘅 個詞出現咗,佢用虛線下划線標記咗:將佢滑鼠游標移到佢(或者撳佢) 一個純語言嘅定義,或者撳一下就可以跳到完整嘅詞彙表 (附錄 B )。每個引文同每個命名工具或者資料來源都係連結咗 到佢嘅主要來源或者官方文件。只想要嘅讀者 故事可以睇第1至3同10節;中間嘅部分記錄咗 詳細嘅工程。

Author and contribution statement. Lingua Mundi 被構思,設計, 而係由獨立研究員拉西爾 · 赫南德斯 · 赫南德斯建造緊 同埋係墨西哥塔巴斯科嘅翻譯員。開發係以一個方式進行 人類主導嘅同商業大型語言模型嘅合作 — OpenAI 嘅 ChatGPT 、人類嘅克勞德同埋 DeepSeek 嘅聊天同推理模型 — 其中 作者用作編程合作夥伴、審查員同埋文件輔助工具。 呢個草稿本身係由一個 AI 代理喺作者嘅指導下寫嘅,而且 遵循工作室嘅驗證準則: [H] 標記咗一個已經驗證嘅事實 針對有日期嘅來源、測量值或者代碼; [O] 標記屬性 解釋或意見; [NV] 標記咗一個唔可能係嘅聲明 已經驗證咗。公開文字係用工作室嘅聲音寫,而唔係用 根據工作室慣例,作者嘅個人聲音。

[H] Studio-voice rule (session log, 7 September 2026): "Studio/PR voice on all external/pitch copy — never Rex's personal voice." [H] Honesty rule: "No lies / no fake confidence" (studio conventions, September 2026).

Abstract

人類嘅字典同字網係有組織嘅 by language :西班牙文嘅一個字 檔案,一個英文嘅,一個日文嘅。但係一個意思例如「家貓」就係 唔係西班牙文、英文或者日文 — 呢個係佢哋所有人同每個人都共用嘅 語言只係用唔同嘅表面形式指向佢: gatocatchatKatze 。 Lingua Mundi (「世界語言」)係一種開放、自由同 試圖反轉平時嘅語言無知詞彙知識庫 組織:而唔係每種語言嘅字典,佢會儲存 concepts (意思)一次,然後將每種語言嘅詞語附加到共享嘅詞語 意思,用開放式數據社群嘅多語言字網作為 對齊鍵。呢個項目係由一個人開發,喺一個人身上 2014年代嘅手提電腦(一個四核英特爾奔騰級處理器,8 GB RAM ,一個 ... 5400 rpm 硬碟,同埋一個慢嘅互聯網連結 — 主機嘅機器 活系統,直接為本文捕捉;睇第9.1節),預算係零,用 只開詞彙數據。喺2025年12月至2026年9月期間呢個項目 由一個下載咗嘅字典檔案嘅資料夾成長到一個正常運作嘅 PostgreSQL 96,434 concepts1,238,383 word forms (lexemes)1,238,383 word forms (lexemes) 嘅資料庫 1,608,018 word senses ,同埋 171,672 semantic relations 橫跨六個直播 語言(英文、西班牙文、法文、德文、葡萄牙文同日文),一 查詢 API , 答案係以毫秒計,同埋一個以「地圖」樣式嘅網絡介面 嘅意義」 — 一個可探索嘅星圖,當中有一隻星可以係 貓 · 加托 · 貓 · 聊天 · 卡茨一次過。呢篇文章記錄咗呢個項目嘅智力 起源(直覺認為意思,而唔係拼寫,係嘅自然單位 多語言語言數據);嘅數學同語言學原理 佢嘅設計(一個語言無知嘅實體模型,基於合成集嘅概念對齊, 一個類型關係嘅分類,齊普夫排名,同埋一個「焗,唔好。」 重新導出「從資料庫實踐中借用嘅物化視圖模式);個 開放數據來源及其授權;工具同埋人類人工智能工作流程 用嚟建造佢;用戶介面及其教學設計;個 沿途發現嘅基礎設施故障 — 包括一個靜音截斷錯誤,短暫地令到英文字 cat 出現 對佢自己嘅概念嚟講係隱形嘅(佢嘅維修鏈,喺2026年9月7日推出,並喺2026年9月8日驗證完成); 項目嘅現狀;同埋佢嘅計劃。 呢篇論文亦都係,隱含地,一個有決心嘅人可以做到啲咩嘅個案研究 用免費工具同借用嘅計算喺開放數據上面建立 — 同埋喺 工程習慣(測量、日期、標籤、承認未經驗證嘅嘢)令到 一個細嘅項目,夠老實,可以成長成為一個大嘅項目。

  • 呢份摘要入面嘅數字同統計數據係喺2026年9月6至7日測量嘅;

有關確切嘅查詢、日期同來源,請睇附件 A 。 *

96,434概念 · 意義
1,238,383詞形 · 詞位
1,608,018詞義
171,672語義關係
6運作緊嘅語言
0.25 s預設星空 · 熱態
AI 生成嘅初步草稿。 呢份文件係由人工智能研究代理喺項目作者 Raciel Hernández 嘅指示下起草。佢唔係最終出版稿——由作者本人撰寫嘅論文仲喺度寫緊——而且未經同儕審查。每一項事實同數字都可以追溯到附錄列出、有日期嘅第一手來源;未經證實嘅陳述會清楚標明。未得作者批准之前,請勿引用。

1 · The intuition: why dictionaries are the wrong shape

One concept, six languages: the domestic-cat synset 02121620-n 02121620-n domestic cat EnglishcatgrimalkinhousecatmouserpussSpanishgatoFrenchchatchatteGermanKatzeKaterPortuguesegatobichanoJapaneseネコ
One concept, six languages — members of the domestic-cat synset princeton-wordnet:02121620-n (verified subset, September 2026).

每個語言學習者都感受到摩擦。你喺一個入面搵 cat 英文 - 西班牙文字典同埋搵 gato 。你喺 a 度搵 gato 西班牙文 - 日文字典同埋搵 。三本字典之後你就有 用咗一個下午去確認你已經懷疑嘅嘢:同一個諗法 — a 小型養殖食肉動物咕嚕咕嚕 — 係被描述三次,喺 三個獨立嘅檔案,由三個唔同嘅組織,有三個唔同 識別碼,而且從來都冇連接過另外兩個。

Lingua Mundi 背後嘅直覺係,呢個係錯誤嘅形狀 語言學數據。意思係存在一次。呢啲字存在好多次。 A 將 meanings 儲存為一級對象嘅資料庫,並將 words 當成 唔同語言附加到呢啲意思嘅標籤,會令一個人 (或者程式)透過單一語言由任何語言轉移到任何其他語言 共用地圖 — 同埋會令學習者一目了然噉睇到嗰隻 貓,加托, 傾偈, Katze, and 唔係五個要背誦嘅事實而係一個事實穿着 五件外套。

呢個直覺唔係雷鳴噉嚟到。佢增長咗,大約一年, 喺特定人嘅日常工作入面 — 同埋最早嘅紀錄片痕跡 佢非常平凡。

1.1 The first message

3 December 2025 上面,作者同 ChatGPT 同 ... 打咗以下嘅嘢(逐字引用;對話仍然開放咗四個人 個半月,最後編輯日期係 2026 年 4 月 21 號) [H]

"I want to find free dictionaries similar to JMDICT and Kanjidict2 for the following languages: Spanish, English, French, Italian, Portuguese, Chinese, Korean and Vietnamese. My intent is to create a unified multilingual database for various purposes. I'm also interested in knowing if similar databases exist for indigenous Mexican languages that I can freely access."

(會議記錄, ChatGPT ,對話「免費多語言字典」, 2025年12月03日;附件 A 入面引用嘅源檔案。)

嗰段短訊息入面有三樣嘢預示咗之後個項目嘅所有嘢 成為咗。首先,命名嘅語言 — 西班牙文、英文、法文、意大利文、 葡萄牙文,同埋後來嘅日文 — 正正就係作者嘅語言 講嘢同埋做翻譯同語言老師(佢會做一套 後來正式化為「 Core 6 」),加上中文、韓文、越南文, 佢計劃喺下一個加入。第二,嗰句「一個 unified 多語言 database" 已經命名咗目標:唔係六個字典,而係一個資料庫 將佢哋全部抱埋一齊。第三,作者諗緊 indigenous Mexican languages 由第一日開始 — 一個絲綢之路,即係 重複返回(探討咗 Lingua Mundi 嘅瑪雅語言整合 喺2026年8月 [H] ,而瑪雅語資源出現喺佢嘅全部 研究筆記)。

呢個訊息背後嘅背景亦都好重要。作者唔係電腦 受過訓練嘅科學家。佢係一個翻譯同語言導師,佢喺 時間亦都認真學日文,砌小工具去整嗰個 學習更容易:漢字同假名學習遊戲同埋日文字典 管道(日本電子書嘅 furigana 編輯器會加入呢個工具箱 後來,喺2026年,作為成為 Shikibu 應用程式嘅項目)。佢屋企 2025年底嘅目錄顯示嗰個學習嘅考古: KANJIDIC2 漢字嘅副本 喺 11 November 2025 下載嘅字典檔案,係一個喬洋漢字清單 月,然後 — 由12月3號嘅對話所促使 — Open Multilingual Wordnet 數據下載到 5 December [H] (檔案時間戳記, / home / rex / ;睇附錄 A )。嘅 ChatGPT 對話 換句話講,12月3號就係鉸鏈:「我需要日文。」嘅時刻 我嘅工具嘅資料」擴大到「我想建立一個統一嘅多語言 資料庫,免費,用喺好多語言,包括我自己國家嘅 語言。」

1.2 From dictionaries to meanings: the December 2025 pipeline

作者之後做嘅嘢可以喺佢建立嘅檔案入面睇到。之間 2025年12月5號同12月16號佢寫,用 ChatGPT 做節目 合作夥伴,一個小型嘅 Python 脚本管道 — extract_omw.pymerge_dicts.pyunified_dictionary_pipeline.pycrossref_deterministic.py — 下載、解析同合併嘅詞彙 將幾個開放來源嘅數據逐漸變成更有結構嘅形式 [H] ( / home / rex/ 入面嘅脚本同日期)。最重要嘅設計決定 呢段時間嘅記錄係喺檔案本身入面記錄咗:管道嘅最後一個 階段,日期係 12 月 16 號,將每個條目分成 four kinds of objectsconceptsenselexemegrapheme (一個字母係寫嘅 例如漢字) — 同埋將佢哋寫入磁碟,寫成 JSON 行 文件。個架構係講緊: sense 係 a 嘅 特定意思 特定字典入面嘅特定字 ;一個 concept 係共同嘅想法 幾種語言嘅幾種感官都指向;同埋個 一個感覺嘅 concept_id 欄位係允許嘅 empty — 意思係「呢個字。」 感覺仲未同一個共同嘅概念連結。」作者嘅筆記喺 嗰個代碼將個方法描述為「零啟發式」:冇模糊猜測,冇 統計相似性技巧去決定兩個字嘅意思係一樣; 只有明確嘅、有文件嘅連結。 [H] (管道代碼和註解, / 家 / 雷斯 / ,2025年12月;附件 A 入面嘅詳情。)

嗰個12月16號嘅架構,係微型嘅,係整個架構嘅 後來叫做 Lingua Mundi 嘅項目:字係語言中生活嘅 ; 意義生活喺一個共享嘅空間入面;同埋硬,誠實嘅問題 — 邊個字入面 邊種語言係指邊個概念 — 從來都唔係偽造嘅。一種未有嘅感覺 連結到一個概念會保留喺資料庫入面,明顯係冇連結,而係 比起被默默估計到位。十個月後,當一個蟲喺一個 進口管道令到英文字 cat 對佢嘅概念嚟講係隱形嘅,即係 作者會用呢啲字眼去描述個原理:更好噉顯示一個 孤兒比隱藏一個( [H] ;睇第7節)。

1.3 The gap, and the widening

Then the paper trail goes quiet for roughly five months — from mid-December 2025 until late May 2026, the available logs contain no dictionary-pipeline work [NV]. This is not unusual for a working translator with students to teach, but it is worth stating plainly: the project's growth was not continuous. It advanced in bursts, separated by weeks or months of other work — a rhythm that would continue throughout 2026.

當個絲線重新開始嗰陣,個野心已經擴大咗。喺 1 May 2026 上面 作者研究緊「 OMW v2.0數據覆蓋率」( Open Multilingual Wordnet 發佈) [H] (對話標題和內容,聊天 GPT ,2026-05-01)。開緊 27 May 2026 佢開咗個對話,題為「開源語言 資源」,實際上係要求每個自由詞彙嘅系統地圖, 文法同語義資源,可以提供多語言知識 基地 [H] (聊天 GPT ,2026-05-27)。到而家個項目已經有個名同埋個 形狀;兩者嘅證據都會喺下一章出現。

1.4 Why this matters beyond one person's project

讀者可能會想知點解一篇論文要記錄個人項目 直覺咁長。答案係直覺係 貢獻。 meanings — 唔係拼寫 — 呢個諗法係自然嘅 單位嘅多語言數據有好長嘅學術血統(佢係最古老嘅 夢想機器翻譯嘅「語言間」傳統同組織 Princeton WordNet 嘅合成集原理;睇第2節),但係好少 由個人行動,冇預算,作為公益。大部分 遵循呢個原則嘅多語言資源 — 開放多語言 Wordnet 、 BabelNet 、 Universal Dependencies 項目 — 都係由 大學聯盟,有資助資金。 Lingua Mundi 係一個人嘅嘗試 獨立研究員,只係用開放數據同免費工具,去建立一個 嗰個基礎設施嘅一部分,佢自己用嚟翻譯同教學 工作,同埋將佢送畀人。嗰個嘗試係咪成功係一個問題 讀者可以從本文其餘部分嘅證據判斷 — 同埋 作者自己嘅期刊顯示佢問緊同一個問題,用同一個問題 誠實,一直以嚟(睇第4.3節)。

2 · Background: what "a map of meaning" means

要明白 Lingua Mundi 係想建立啲咩,同埋啲咩係真正嘅新嘢 關於呢個問題,之前嘅工作有三條線係重要嘅:語言學嘅概念 意思可以同拼寫分開;計算想法係噉嘅 意思可以儲存為數據,並且可以跨語言連結;同埋現代嘅 觀察到結構化嘅意義地圖係補充 — 而唔係 同 — 神經語言模型競爭。

2.1 The sign and its two faces

現代語言學通常都係由一個看似簡單嘅觀察開始 歸功於費迪南德 · 德 · 索索喺二十世紀初嘅講座:一個字 係一個 sound/shape (「能指」)同一個 concept (個 「表示」)( de Saussure, 1916/1983 )。兩種語言,喺呢個觀點上,唔係 兩組偶然翻譯嘅字;佢哋係兩組 signifierssignifieds 嘅共用空間上面部分重疊。英文 表示符 cat 同西班牙語表示符 gato 係唔同形狀嘅 同一個意思。如果一部機器可以儲存一次指示物,然後附加 對佢哋嚟講,翻譯會變成一個透過共享嘅查找 中間 — 呢個喺機器翻譯入面被稱為 interlingua 嘅想法 方法:唔係直接翻譯英文 → 西班牙文,而係翻譯 英文 → 意思 → 西班牙文。

語言間夢係機器翻譯研究同 ... 反覆證明太難喺完全一般性(語言唔雕刻 意思分成相同嘅部分,而每個翻譯者都知道 cat 係 動物同 cat 爵士音樂家係唔同嘅意思戴住一個 指標)。但係個夢從來都冇死過;佢只係縮窄咗成啲嘢 可建立:詞典,語言中最好映射到穩定嘅部分, 共同嘅意思。

2.2 WordNet and the synset

決定性嘅縮窄係嚟自心理學同詞典學。喺1980年代 同埋喺1990年代,乔治 · 米勒同普林斯頓嘅同事建立咗 WordNet ,一個 英文嘅詞彙資料庫唔係按字母順序組織,而係按 semantically 組織 ( Miller, 1995Fellbaum, 1998 )。 WordNet 嘅核心發明係 synset (「同義詞集」嘅縮寫):一班可以代表嘅字 喺某啲情況下有相同嘅意思。合成集 { 貓,真貓,貓貓, 國產貓 } is one meaning; the synset { 貓,貓 , guy, hombre } — 意思係「一個青年或者男人嘅非正式用語」 — 係另一個,完全唔同 意思係巧合地共用表示者 cat 。 WordNet 也有記錄 同步集之間嘅 relations — 最重要嘅係 is-a 層級 (假名:一隻家貓 is an 貓科動物,一隻貓科動物 is an 食肉動物,一 ... 食肉動物 is an* 哺乳動物⋯) — 將字典變成圖表,用 意思係節點,類型關係係邊緣。

WordNet 對 Lingua Mundi 嚟講係重要嘅,原因有三個。首先,佢證明咗一個 按意思組織嘅機器可讀詞典係可行嘅,而且係巨大嘅 有用 — 現代搜尋引擎、拼寫檢查器同自然語言 圖書館仲係靠佢。第二,佢畀咗個 穩定嘅識別碼世界 系統為意思: Princeton WordNet 編號佢嘅合成集,所以 02121620-n 明確嘅意思係「家貓」,可以引用 資料庫。第三,佢成為咗一個多語言項目嘅錨點:個 Open Multilingual Wordnet (OMW)

2.3 The Open Multilingual Wordnet: one meaning, many languages

由弗蘭西斯 · 邦德同瑞安 · 福斯特( Bond & Foster, 2013 )推出嘅 OMW , 收集用好多語言建立嘅字網,然後將佢哋同普林斯頓大學對齊 英文 wordnet :每種參與語言嘅合成集都會帶指針去 佢哋對應嘅英文合成集。結果係資源所製造出嚟 Lingua Mundi 可能:一組明確嘅、人為策劃嘅陳述 form " 西班牙文 gato* ( 意義 1 ) 同英文屬於同一個意思 家貓合成集 02121620-n 。 "當 Lingua Mundi 作者喺佢嘅 2026 年 7 月工程規格,話呢個項目會「以合成集為中心」 同埋會透過 OMW [H] (規格文件, 2026年7月24日),佢企喺邦德同福斯特嘅肩膀上面 — 正如佢嘅 2025年12月嘅管道脚本,直接解析 OMW 嘅數據檔案, 已經係。

2.4 The open-data ecosystem around the wordnets

OMW 係一個大型、公開授權嘅生態系統入面嘅一個節點,即係個人 可以合法同技術上結合:

  • Wiktionary — 由維基媒體主辦嘅協作字典

基金會 — 提供幾百種語言嘅非常廣泛嘅詞彙覆蓋, 包括定義、翻譯、彎曲同發音,喺下面 共享授權( Wikimedia Foundation ;另請參閱[梅耶同古雷維奇, 2012]( https://doi.org/10.1093/acprof:oso/9780199654864.003.0013), 關於佢作為專家詞典競爭對手嘅價值)。

  • Wikidata — 維基媒體嘅結構化知識庫 — 儲存陳述

有機器可讀嘅識別碼,並且根據 CC0(公開 域)( Vrandečić & Krötzsch, 2014 )。

超過一百個語法註解句子樹庫 開放授權下嘅語言( Nivre et al., 2020 )。 UD 有貢獻 真實嘅句子同語言部分嘅資訊 — 證明啲字係點樣嘅 其實用過。

由吉姆 · 布林嘅 EDRDG 項目維護,覆蓋日文 廣泛,並翻譯成多種語言( Breen, 2004 )。 呢啲係作者嘅出發點(佢第一個字典檔案, 喺2025年11月下載,係 KANJIDIC2 [H] )。

  • UniMorph — 一個多語言嘅屈折形態學存儲庫(字

形式如 run/ran/running 按文法特徵組織) ( Kirov et al., 2018McCarthy et al., 2020 )。

  • OPUS — 提取咗大量平行(翻譯)嘅句子

從網絡同電影字幕,公開授權( Tiedemann, 2012 )。

根據佢哋喺真正嘅語庫入面有幾常見。

  • The ISO 639-3 standard ,佢會為每種人類語言指定一個穩定嘅語言

三個字母嘅代碼(例如,西班牙文嘅 spa ,日文嘅 jpn ),維護 由 SIL International — Lingua Mundi 資料庫用呢啲代碼做佢嘅 language[H] 嘅密鑰。

呢個生態系統嘅兩個性質值得強調,因為佢哋構建咗生態系統 成個項目。首先,牌照係真正開放嘅 — 允許性或者 分享一樣 — 所以只要將佢哋組合成一個派生嘅資料庫係合法嘅 歸因同授權條款都受到尊重( Lingua Mundi 記錄咗來源 同埋每個匯入嘅數據集喺佢自己嘅 source 表入面嘅授權;睇一節 6)。第二,生態系統係 complementary : Wiktionary 係廣泛但係 淺;啲字網好深,但係好窄; UD 係關於使用; UniMorph 係 關於字形;頻率清單係關於突出度。工程學 Lingua Mundi 嘅問題唔係「搵數據」 — 而係「合併從來都冇嘅數據」 設計嚟合併,而唔係講大話關於聯繫。」

2.5 Why a map of meaning still matters in the age of large models

一個公平嘅異議必須要明確噉講:如果大型語言模型已經可以 翻譯、定義同推理啲字,點解要喺呢度建立一個結構化嘅詞典 全部? Lingua Mundi 作者嘅答案,係佢喺2026年6月嘅研究中發展出嚟 紙(第 3 節)同埋經過夏天嘅改良,有三個部分。首先, verifiability :一個結構化嘅資料庫可以顯示佢嘅工作 — 每個連結都有一個 來源同牌照同日期 — 而模型嘅知識係唔透明嘅 唔可以審計、更正或者引用嘅統計混合物。第二, cost and access :查詢本地資料庫冇乜費用,而且有效 離線,而每個模型查詢都需要花費精力、金錢,或者兩者都需要;作者嘅 常設設計規則係「零令牌研究查詢」 — 本地 API is 研究表面 [H] (項目筆記,2026年8月29日)。第三, complementarity:2026 年 6 月嘅論文論證咗 — 作為一個假設,同 三個模型嘅審計,都係喺同一個判決上聚集 — 即係一個緊湊嘅模型 透過概念識別碼而唔係原始憑證進行操作可能會多好多 有效嘅正正係因為概念圖喺外面做語義工作 網絡(睇第3節)。無論嗰個假設係咪存在 實驗,地圖本身對模型仍然有用:作為一個外部 可以喺唔使重新訓練嘅情況下查詢、更新同引用嘅記憶體。

因此, Lingua Mundi 嘅智力血統可以歸納為一個 行:佢係語言間夢,由 WordNet 縮窄到詞彙,做咗 多語言由 OMW , 由開放數據運動合法化,並由 個人係由一個翻譯者需要一本處理意思嘅字典,而唔係 語言,作為被提交嘅嘢。

3 · The name, the thesis, and the seven-graph architecture (May–June 2026)

3.1 Naming

喺2026年5月下旬,作者嘅筆記同規格用咗呢個工作標題 「多語言詞彙平台」 [H] (降價規格主日期 2026年5月23日, / home / rex / 德斯卡加斯 / 電話備份 / 下載 / )。個名 林瓜 Mundi — 拉丁文嘅「世界語言」 — 首先出現喺可用嘅語言入面 喺 1 June 2026 上面嘅記錄,作為一份研究稿件嘅標題(睇 下面) [H] (對話記錄,2026年6月1日;最早驗證嘅發生 喺作者嘅檔案入面)。個名好啱:個項目嘅聲稱唔係噉嘅 佢包含好多語言,但係佢係 about the one space of meaning 嗰啲語言共享。

3.2 A research thesis: meaning, not tokens

大約喺2026年3月至6月期間,作者喺對話中發展出嚟 同 ChatGPT 、克勞德同 DeepSeek — 一篇關於點解一個嘅研究論文 概念層面嘅語言地圖可以令到語言技術更加重要 有效同埋易於使用。論文,喺工作框架作者 帶嚟對話(逐字引用佢嘅可行性要求 2026年7月18日,佢貼咗個描述畀人睇) [H]

"Create a multilingual, open, machine-readable map of human language that separates: 1. Meaning · 2. Form · 3. Structure · 4. History · 5. Usage — into interoperable graphs. The long-term objective is to make language computable at the concept level rather than the token level. […] Modern NLP largely models: token → token. Lingua Mundi models: concept ↔ language."

喺六月嘅稿件入面所講嘅根本論點,就係一種語言 型號用咗大部分容量喺 surface variation — 醫「狗」, 「 perro 」,同埋「犬」作為三個無關嘅嘢,當佢哋係三中一嘅嘢 外套 [H] (手稿 V4,喺審計對話中全文引用 2026 年 6 月 1 號)。如果一個模型可以改為讀寫 concept sequences — 用概念圖喺網絡之外做多語言工作 — 模型可以細啲、平啲,同埋可以喺普通電腦上面運行。

3.3 Seven versions in one morning: the adversarial-collaboration method

稿件,題為 Lingua Mundi : 語義基礎架構 以概念為基礎嘅語言模型 ,提出咗一個 seven-layer 架構: 一個概念圖(語言獨立嘅意思,目標大小十億 節點),一個合成圖(將每種語言嘅詞語映射到概念上),同埋 形態學、衍生、語源、跨語言嘅圖表 對應同埋用法 — 全部都係由一個共同嘅識別碼系統連接埋一齊;加一個 概念基礎模型架構(曼巴式序列模型讀取 概念識別碼),概念嘅双曲(龐加萊球)嵌入 圖表,明確嘅圖表擷取事實,同埋一個經審計嘅預算,顯示出嚟 成件事啱晒普通手提電腦 [H] (手稿,2026年6月1日)。

令到呢集成為 method 嘅原因 — 同埋記錄得非常好 — 係作者唔係一個人寫稿。喺嘅朝早 1 June 2026 佢喺 ** 連續七次修訂之後執行咗個草稿 ( V1 – V7)喺半個鐘以內 ,用兩個型號作為對手: DeepSeek 起草咗每個修訂版本,而 ChatGPT 就會用 一個敵對嘅同行評論員 [H] 嘅嚴謹(對話記錄, DeepSeek 「 Lingua Mundi 嘅預檢修正」同 ChatGPT 「審計 意見 Lingua Mundi 」,兩者都係2026年6月1日)。審計成績單係 逐字逐句噉保留,同埋對每一輪嘅固定內容都非常坦率:

  • INT8嵌入儲存嘅算數已經校正咗(一個因子外 -

儲存預算中有兩個錯誤);

  • 一個炮製嘅實證主張(「經驗上,我哋發現⋯」)被移除,然後

用一個明確標記嘅假設取代,呢個假設係基於之前嘅工作;

  • 同假設未來模型嘅比較被用 a 取代

同真實嘅比較(深尋 -V3);

  • 摘要嘅表現主張逐漸縮窄;
  • 冇支持嘅縮放聲稱被重新標記為開放式研究問題;同
  • 呢份手稿由 V7重新框架,由一個實證主張變成一個誠實嘅主張

立場文件 — 一個有明確可偽造評估嘅研究議程 計劃(字義消歧韌性,消融,基線)。

審計嘅最終判決,保存喺日誌入面,對稿件嘅評分 vision 高,同時一貫將 empirical support 分級低 — 同埋 上次審計嘅結束建議係直率嘅 [H]

"If I were advising the project, I would now pivot from paper-writing to implementation. The next valuable artifact is not V8. It is Lingua Mundi Prototype 0.1 … with: 100k–1M concepts, English only, concept tokenizer, concept reconstruction, TinyStories training run, direct comparison against token-Mamba. That experiment would answer the central question: does semantic compression preserve enough information to justify the bottleneck?"

作者遵循咗呢個建議。關於呢集嘅三個觀察係重要嘅 為咗理解之後嘅所有嘢。首先, idea 從來都唔係 瓶頸 — 作者用佢自己嘅語言講,有一個審計評分為 A − 嘅願景; 瓶頸係證據,審計報告七次噉講。第二,係 作者嘅工作方法 — 用多個 AI 模型作為對手 協作者,保留每份草稿同每次審計,而且偏好誠實 資格勝過自信過度聲稱 — 成為工作室嘅永久 標準,而且係喺 [H]/[O]/[NV] 驗證入面見到嘅同一個方法 本文嘅慣例(附錄 A )。第三,七層 當作者轉向嗰陣,嗰份六月稿件嘅建築並冇消失 到實施:佢成為咗個項目嘅 roadmap 。 Lingua Mundi 嗰個 今日(2026年9月)實現咗個概念圖,即係合成圖, 形態學匯入,語料庫層,同埋一個 API ;派生,語源, 對應,同埋使用層係明確排隊嘅階段 計劃(第 5 至 6 節,10.3) [H] (項目路線圖,2026年8月29日)。

4 · The platform takes shape (July–August 2026)

4.1 Feasibility: "can this be done with open-source components?"

18 July 2026 上面,作者直接問 ChatGPT ,係咪願景 可以由現有嘅免費組件同埋佢需要嘅嘢去建立 開發佢 [H] (對話「 Lingua Mundi 項目可行性」, 2026-07-18,00:44 UTC — 作者中部時間 7 月 17 號晚 區域)。對話 — 同埋之後嘅幾個星期 — 記錄咗 由研究論文轉向工程計劃。呢個項目採用咗 佢將正式嘅使命宣言貼喺嗰段對話入面嚟睇睇(引用 喺第3.2節),而作者就開始咗 脚手架實際代碼:數據模型嘅架構檔案存在於有日期嘅磁碟上面 2026年7月17日 [H] (代碼快照,2026年7月;睇附件 A )。

4.2 The engineering specification (24 July 2026)

24 July 2026 上面,作者將個設計整合成一本104頁嘅書 工程規格, 多語言詞彙平台 — 工程 規格 ,2.0版本,副標題係「修訂同生產準備好」 [H] ( PDF , / home / rex / ,2026年7月24日;為本文提取嘅文字)。個 規格係個項目嘅憲法,而佢嘅內容解釋咗大部分 後來建造咗啲咩:

  • The synset-centric principle. 文件指出,每個詞彙

物件最終必須附加到一個 synset (一個意思),同埋嗰個 資料庫係圍繞住意思而唔係拼寫嚟組織。佢有效 例子係 bank 呢個字,佢一定係一個表面形式同幾個 唔同嘅合成集(「河岸」、「金融機構」、「銀行」 有啲嘢」) — 從來都唔係一個未分化嘅意思 [H]

  • Language tiers. 規格計劃咗兩層語言:

推出嘅第一層 — 英文、西班牙文、法文、葡萄牙文、日文同埋 普通話(簡體同繁體) — 同埋第二層 — 意大利文, 韓文,同埋越南文 [H] 。 (嗰套實際喺 資料庫有兩個有趣嘅分別,記錄喺第10節: 活六係英文、西班牙文、法文、德文、葡萄牙文、日文 — 普通話同意大利文缺席,德文出席。替代係 喺現存嘅記錄 [NV] 入面冇任何地方解釋過,呢個係一個坦率嘅承認 一個未解決嘅來源問題。)

  • The data model. 規格嘅第5章概述咗個架構

大致上,而喺存儲庫第一次轉移中運送嘅模型係 一個十一表核心匹配 2025年12月原型嘅四實體直覺,而家正式化咗: 語言,詞素,感覺,概念(合成),關係,來源, 合成集,同埋支援表(睇第5節)。

  • A five-level alignment hierarchy. 因為自動同手動連結

提出嘅規格,字詞同概念嘅可靠性有所不同 五個對齊信心級別,來自明確嘅來源連結 (例如 OMW 映射)落到啟發式猜測 — 規則係每個 儲存咗嘅連結帶有佢嘅信心水平。呢個係成熟嘅形式 2025年12月「零啟發式」規則:唔係 no 自動連結,而係 labeled, honest 連接 [H]

  • A phase roadmap with gates. 第 0 – 5 階段,每個階段都有一個退出準則,

由架構同 ETL 到 API 到應用程式。

  • A risk register — 包括一個提出語源嘅自我批評附件

同埋 CJKV / Unihan 層層疊,警告日中「假朋友」 (例如日文嘅娘「女兒」 vs 中文嘅「媽媽」;手紙「信」 vs 。 「廁紙」) [H]

規格亦都修正咗項目之後會簡化嘅堆栈: FastAPI 、 PostgreSQL 、一個搜尋引擎(規格中嘅 Meilisearch ),同埋一個 網絡前端( Next.js )。值得注意嘅係,到咗8月13號,作者已經係 質疑嗰個堆疊自己(第4.4節)。

4.3 The July journal: thinking about the semantic operating system

大約係同一日,作者嘅私人期刊 ( knowledge project.txt ,85 KB ,本文全文閱讀;檔案時間戳記 2026年7月18日,單一工作會議)記錄咗一個相關同更個人嘅事 絲:佢嘗試諗清楚一個 「通用語義圖」 — 一種獨立於記號嘅方法去表示意思 呢個可以跨越編程語言、音樂理論、化學同埋 自然語言(佢叫做 USG 嘅獨立項目) [H] (期刊, 2026年7月)。呢本期刊最相關嘅語言同蒙地語嘅段落(第2563行 – 2587)係佢對渲染 one semantic object 嘅意義嘅反思 一次過用三種語言 — 同 cat · gato · 猫 一樣嘅直覺, 寫成一個思考介面而唔係語言嘅練習 [H] 。講緊嘅係,呢本期刊自己嘅「語言」例子 解釋係 Lingua Mundi 代碼庫嘅 LanguageCreate 架構 — 證明 到七月中,兩個主題(研究願景同實際代碼)都係 已經係佢腦海入面織埋一齊 [H]

4.4 August: from schema to running system

2026 年 8 月係 Lingua Mundi 成為 system 嘅時候。幸存嘅日誌顯示 a 密集嘅決定序列,每個都留下佢嘅痕跡:

  • 1–8 August. 作者探討咗圖表同知識表達

選項(「 JSON 作為圖表」,7月29日; API 營利想法,8月7至12日) 同埋 — 對最終架構嚟講係至關重要 — 問 API 係咪 「真係需要」一個重嘅堆疊(第4.5節) [H]

  • 11 August. 佢探討咗將 Maya languages 整合到語言入面

蒙迪(「 Lingua Mundi 瑪雅整合」),繼續對 墨西哥原住民語言喺2025年12月嘅訊息 [H] 入面首次發表。

  • 13 August. 兩次設計對話確定咗個形狀嘅

產品:「語言學 API 技術堆栈」(睇4.5)同埋「語義互動 層」,佢描繪咗知識層之間嘅未來介面 同埋應用程式 [H]

  • 19–25 August. 佢整咗個 Japanese demonstration :一個緊湊型

離線資料庫( SQLite )捆綁日文字典資料,令到 概念導向嘅設計可以被觸摸、查詢同埋向其他人展示 (「建立日本示範」;所得嘅 lingua-mundi-jpn.sqlite 檔案係 保存喺磁碟上面) [H] 。衝刺有個具體嘅截止日期同埋 觀眾: Japan Foundation 嘅代表係佢嘅 大學第二個星期,同埋示範(同 furigana 一齊 同期改名為 Shikibu 嘅編輯器)係準備為 嗰次訪問嘅留低產品檔案 [H] (對話記錄, 2026年8月19日至25日)。

  • 23 August. 問到一個概念嘅一段描述,佢

聽返個同日誌顯示佢建造嘅嘢相符嘅總結:「 a 人類語言嘅機器可讀語言基礎架構⋯相反 比起只係一個日文字典或者翻譯應用程式, Lingua Mundi 係 打算成為一般語言智能層 " [H] — 同埋,喺同一個對話入面,有個 technical 描述,命名為 然後計劃堆栈( PostgreSQL , Apache AGE 用於圖表查詢, OpenSearch 為咗擷取, FastAPI 作為下個月嘅測量值嘅 API ) 會令到唔需要(第4.5節,第6節) [H]

  • 24 August onward. 代碼庫搬入佢嘅永久家園,係一個

正確嘅存儲庫(「 LinguaMundi 」),同埋每日嘅 GitHub 備份快照 由 8 月 27 號開始嘅步道 [H] (存儲庫快照;睇附件 A )。

4.5 The lean-stack decision that shaped everything

月最有影響力嘅技術決定係逐字保留嘅。開緊 13 August 2026 作者貼咗佢自己計劃嘅技術堆栈 — 快速 API 、 PolarsDuckDB 、 PostgreSQL 、阿帕奇 AGE (圖表擴展)、 開啟搜尋、 RedisCeleryReactDocker — 同埋問:「係咪 ... 語言學 API 如果已經喺 postgres 上面跑緊,真係需要呢個堆栈?」 [H] (對話「語言學 API 技術堆栈」,2026年8月13日)。

佢收到嘅答案 —— 同埋採用咗 —— 係幾乎唔需要任何一個 但係:單獨 PostgreSQL 可以提供關係字典數據,漢字, 閱讀、聯合、翻譯、全文搜尋,甚至係圖表式 递彈查詢,而正確嘅規則係「 PostgreSQL 限制 → 加 技術」,而唔係「第三階段話圖表資料庫 → 安裝圖表資料庫」 [H] (同一個對話)。呢個建議嘅結論係:「你部 API 好有競爭力 優勢唔係基礎設施。佢係語言學數據模型同埋 你喺數據上面建立嘅轉換 " [H]

呢個決定 — 一個關係式資料庫,一個 API 框架,乜都冇 否則直到測量需要 — 係表現嘅直接祖先 第 6-7 節所講嘅架構。當,喺2026年9月, 資料庫增長到160萬個字義,而天真嘅查詢就減慢咗 分鐘,作者冇去到圖表資料庫或者搜尋引擎: 佢伸手去攞 PostgreSQL materialized views — 「焗,唔好。」 重新衍生」模式 — 同埋將最慢嘅查詢由超過一分鐘減少到 2014年嘅硬件上大約一秒(第7節)。八月嘅決定 保持精益係令到九月優化嘅必要同 可能。

4.6 The human-AI development method, in practice

呢個歷史嘅讀者會留意到,幾乎每個里程碑都係 附上對話記錄:作者喺對話中思考。到八月 2026年佢嘅方法已經穩定成可以形容嘅嘢 正確嚟自記錄:

  1. The human sets the direction and owns the data. 每個要求都係

記錄係作者自己嘅;每個檔案都喺佢部機上面;每個決定 — 包括好似精益堆栈問題噉嘅逆轉 — 係佢嘅。

  1. 用咗 AI models are used as specialized collaborators. 聊天 GPT

大量用於研究、建築批評同審計;深層尋找 起草同修訂週期同埋(之後)作為底層嘅繩索 工作室自己嘅自動化;克勞德為長視野記憶同項目 上下文(工作室嘅知識庫係由克勞德記憶體匯出開始)。

  1. The record is kept. 對話會匯出(作者嘅封存檔案

包含幾千個),代碼會快照,而且 — 由2026年8月26日起 — 每個 工作工作階段會用嚟登入 Obsidian 知識庫 前線事項、日期同驗證狀態(第9節)。呢篇論文係 只係因為嗰個記錄習慣先有可能。

  1. Adversarial review is built in. 6 月稿件嘅 V1-V7審計

循環(第3.3節)成為咗一個常設嘅做法:草稿係由 a 審計 同寫佢哋嘅模式唔同,而且審計會繼續進行 檔案。

無論係叫呢個「 vibe 編碼」、「 AI 輔助開發」,定係簡單嚟講 「使用工具」,誠實嘅標籤對記錄好重要: ** Lingua Mundi 係一個由人為嘅項目,係喺刻意、有文件嘅合作下建立嘅 同 AI 助理 ,同埋呢篇論文(本身係一個由 AI 生成嘅草稿,喺 作者嘅指示,根據前線通知)係一樣嘅神器 方法。

5 · Design: the linguistic and mathematical principles of the model

呢個部分用簡單嘅語言解釋決定語言嘅想法 Mundi 儲存語言。想要 history 嘅讀者可以跳到第 6 節; 想要 formulas and schema 嘅讀者會喺呢度同入面搵到佢哋 附錄 A 。

5.1 Four kinds of objects, one space of meanings

呢個數據模型係由2025年12月管道嘅四個直接衍生出嚟 實體類型(第1.2節)同埋由2026年7月規格嘅十一個 表 [H] 。喺佢嘅成熟形式下,佢儲存咗五種核心嘅嘢 (根據實時架構驗證,2026年9月 [H] ):

  • Language — 每個人類語言一行,由 ISO 639-3鎖定

三個字母嘅代碼( engspajpn ,⋯),同佢個名,自體名(個 講者用嘅名)、語言家族同埋寫作劇本。 加緊一個 整個系統嘅語言係,根據設計,加一行加數據集: 喺任何地方都冇每種語言嘅表格 [H] (代碼同項目筆記, 2026 年 8 月 29 號)。呢個「語言無知」屬性係架構級別 語言間思想嘅表達(第2.1節)。

  • Lexeme — 特定語言嘅字形:字串 cat ,即係

字串 gato ,字串 。一個詞素完全屬於一種語言 同埋帶有語言嘅一部分。

  • Senseone meaning of one lexeme as recorded by one dictionary

「貓」係動物嘅意思,係嚟自 WordNet ,「貓」係爵士音樂家嘅意思 WordNet ,「貓」嚟自 Wiktionary 嘅聖誕節日誌感覺。一個詞素通常有 好多感覺 — 呢個係個模型點樣代表 polysemy (一個字, 好多意思)而唔會將意思崩潰埋一齊。一種感覺可能或者 可能仲未同一個概念連結;個連結係 concept_id 個欄位, 而佢係 nullable by design — 一個未連結嘅感覺被保留同顯示為 孤兒而唔係估到嘅地方 [H] (架構;管道筆記, 2025年12月)。

  • Concept — 一個意思,跨語言共享:概念

由 Princeton WordNet 同步集 URI 識別嘅「家貓」 princeton-wordnet:02121620-n [H] (實時資料庫)。概念喺邊度 多語言對齊發生:西班牙文 gato (其中一個感官), 英文 cat 、法文 chat 、德文 Katze 、日文 都可以 同一個概念 — 佢哋係「一粒星」,有好多名 (第8節)。概念表係個系統嘅核心,而且喺 目前嘅資料庫,保留96,434行 [H] (測量,9月6至7日 2026)。

  • Relation — 兩個概念之間嘅打字、有向連結,

例如,家貓 IS_A 貓,或者貓 IS_A 食肉動物。關係 帶有述語、信心同來源。目前嘅資料庫保留 其中171,672個係 [H] (測量,2026年9月6日至7日)。

呢五個坐喺度嘅來源機械 — 一個 source 表錄音 每個資料集嘅來源、授權同埋網址(所以冇任何聲明 個資料庫永遠都係冇歸因),同步表橋接到 OMW 格式,同埋漢字同讀法 [H] 嘅支援表格(架構, 2026年9月)。

5.2 The alignment problem, and why it is not faked

多語言意義地圖嘅中心智力問題係 alignment :決定 this 語言中 this 字嘅 this 意義 係 the same meaningthat 語言入面 that 字嘅 that 意思。 Lingua Mundi 嘅答案,係繼承咗 OMW 設計,就係由 not 決定 fresh: OMW 已經指出,每種語言,邊個合成集對應 到 Princeton WordNet 同步集,所以資料庫會匯入嗰啲明確嘅 映射作為佢嘅主要對齊層 [H]Bond & Foster, 2013 ;匯入 代碼)。如果冇明確嘅映射,系統就會應用佢嘅 五層次 信心層級 (嚟自2026年7月嘅規格):明確 來源所述嘅連結排名最高;推斷嘅連結排名最低,並且會被儲存 with their level — 從未默默宣傳為「事實」 [H] (規格,2026年7月24日)。呢個係十二月規則嘅成熟形式 作者喺佢嘅管道代碼入面潦草寫咗:「零啟發式」。唔係噉嘅 個系統永遠唔會估到;就係猜測被標記為猜測,即係 係令到個數據庫 honest enough to grow 嘅原因:一個錯誤嘅猜測,即係 標記為猜測可以搵到同修正;錯誤嘅猜測儲存為事實 毒死下游嘅所有嘢。

同樣嘅哲學支配住語言嘅粒度。 ISO 639-3 分辨真正嘅語言,而唔係政治界線或者寫作體系 變種。作者為未來標記咗一個真正艱難嘅案例: 韓國人,佢嘅單一 ISO 代碼 kor 涵蓋咗兩個共和國嘅標準 韓國同韓國民主人民共和國嘅標準。個 現存嘅記錄顯示呢個被標記為開放建模決定 [H] (會議記錄,2026年9月7日) — 架構原理嘅一個例子,即係 佢儲存 languages , 而唔係語言環境,同埋提醒現實世界嘅語言 數據抵抗每語言一行嘅整齊框。

5.3 The graph: taxonomies, neighborhoods, and the long tail

一旦感官同概念一致,而關係就連接概念, 資料庫 is 一個圖表:96,434個意義節點由171,672個類型邊緣連接起嚟, 最大嘅成份係由 WordNet 繼承嘅 is-a 分類 (哺乳動物 → 食肉動物 → 貓科動物 → 家貓),由實例富集, 嘅一部分,同埋跨語言關係 [H] (測量,2026年9月; 架構)。關於呢啲圖表嘅三個數學事實塑造咗用戶 介面同工程:

  1. Taxonomies are trees of meaning. 因為每個概念嘅父母都係

知道,個系統可以答「呢個係咩類型?」 (爬上去)同埋 「呢啲係啲咩類型嘅?」 (爬落去) — 背後嘅操作 介面嘅分類鏡頭(第8節)。

  1. Degree distributions are Zipfian. 真實語言圖表係

scale-free-ish :幾個概念(例如「動物」、「人」、「事物」)都有 巨大嘅社區,而大部分概念都有少數嘅鄰居。 呢個「長尾」係同 Zipf 出名測量嘅統計形狀一樣 字頻( Zipf, 1949 ):少量字數佔大部分 用法。以下係兩個設計後果:排名一定要存在(你唔可以 顯示一個查詢嘅 30,000 個意思),而排名必須係 meaningful — 所以個介面會根據佢哋嘅 sky brightness 去排名概念,一個 代理一個意思有幾「重要」或者有幾好連結(第5.5節)。

  1. Shortest paths are the natural translation route. 給出兩個概念,

圖表可以搜尋連接路徑 — 後面嘅操作 介面嘅六分儀工具(第8.4節),以有界嘅形式實現 分類學上嘅雙向廣度優先搜索( ≤ 10次跳躍, 每個節點25個鄰居,以毫秒計回答) [H] (代碼,實時 測量,2026年9月)。

5.4 Zipf and the shape of dictionaries

Schematic Zipfian long tail: the head is baked, the tail stays relationalthe headfew words, most usage —baked into ranking viewsthe long tailrare words stay in therelational tablesschematic — Zipf's law: frequency ∝ 1/rank (Zipf, 1949)
Schematic only — it illustrates the design consequence of Zipf's law described in Section 5.4.

Zipf 嘅定律值得一個明確提及,因為佢靜靜地解釋咗 整個性能架構。如果字頻率遵循幂定律,噉 任何字典都係由一個短嘅常見字頭同埋一個 稀有嘅有天文咁長嘅尾巴。 2026年6月嘅手稿甚至係衍生出嚟 概念詞彙 [H] 嘅基於 Zipf 嘅覆蓋率計算 (手稿 V7審計,2026年6月1日)。對於資料庫嚟講,長尾係指: 大部分 rows 都係罕見字,大部分 queries 都係常見字,同埋任何查詢 一定要掃描成個表格 — 包括所有罕見嘅字 — 係 比起可以由預先計算開始嘅查詢慢得災難性 排名。第 7 節嘅物化視野模式,喺底部,係一種方法 將 Zipf 嘅定律由一個性能敵人變成一個設計工具:焗個 head (排名,每個概念嘅頂級字詞)一次,然後畀 tail 留喺關係表入面,搵實際需要嘅罕見查詢。

5.5 Sky brightness: one ranking to rule the map

個介面嘅組織比喻係一個 star map (第8節),同埋個 比喻係有實際嘅計算支持。每個概念都分配咗一個 brightness — 用嚟排序天空嘅數字幅度 — 由點樣得出 佢喺多語言圖表入面:有幾多語言有字附加, 嗰啲字集有幾豐富,同埋呢個概念喺 分類學。個數據庫將呢個實現為 concept_sky_rank ,一個 預先計算排序所有 96,000 多個概念,以便「給我天空」 從來都唔需要喺要求時排序一百萬行 [H] ( 脚本同 測量,2026年9月6日)。兩個伴隨嘅視圖 — concept_lang_rank (每種語言排名)同 concept_word_rank (每個語言嘅前四個字 每種語言嘅概念,「焗」到用佢嘅字去充實一隻星星係一個 lookup ,唔係一個超過160萬個感官嘅加入) — 完成排名系統 [H] (指令碼,2026年9月6日;附件 A 嘅行數)。

5.6 Bounded work: the game-designer's discipline applied to a database

最後嘅設計原則係借鑑電子遊戲嘅。遊戲渲染一個 無論呢個世界有幾大,都係喺16毫秒內拍攝:佢嘅預算係有效嘅 每幅。 Lingua Mundi 適用相同嘅學科 — 每個有限制嘅工作 喺無限數據空間上面查詢 — 因為佢嘅硬件要求佢( a 2014年代嘅手提電腦;第 9 節)。冇要求可以掃描成個語料庫;每個 要求必須由索引或者烘焙視圖開始;個介面一定要渲染 只有當用戶做某啲嘢嗰陣(閒置 CPU ≈ 0 % );同埋結果係分頁嘅 有穩定嘅窗戶。第 6 同第 7 節顯示咗三個表演牆 紀律打擊同埋每個係點樣用同一個模式去解決: 焗,唔好 重新衍生。**

6 · Architecture: importing the world, serving the map

6.1 The pipeline: one registry, twenty-plus importers

每個數據集都會透過 importer 輸入 Lingua Mundi — 一個程式 識得讀取一個外部格式同埋將佢寫入正規架構。 單一權威嘅進口商名單喺一個檔案入面,即係進口商 注册表;到2026年9月,佢包含咗超過二十個註冊嘅外掛程式 覆蓋: Princeton WordNet 和英文 WordNet , Open Multilingual Wordnet ( OMW ), Wiktionary 及其機器可讀衍生物 kaikki , Wikidata , UniMorph 和 J-UniMorph (形態), Universal Dependencies 樹幹( UD ), OpenThesaurus (德文同義詞),係[ CMU 發音 字典]( http://www.speech.cs.cmu.edu/cgi-bin/cmudict), IDS character decompositionsCLICS 跨語言數據, 字頻列表,同埋日文家族 — JMdict 、 EJDict 、 KANJIDIC2 [H] ( 進口商登記資料庫同項目筆記,已存取 2026 年 9 月 6 至 7 號)。 (精確度有一個警告: OPUS 並行嘅資料夾 corpora 存在於匯入者目錄入面,但係佢係一個空嘅,未註冊 等待路線圖嘅句子層嘅 stub — 佢喺呢度列出嚟係為咗誠實, 唔係作為出貨來源 [H] (代碼庫存,2026年9月6至7日)。) 每個進口商都會註冊佢哋嘅目標語言 相同嘅 ISO 代碼,呢個就係令到架構語言無知嘅原因 實踐,唔止係理論上 [H] (代碼)。

匯入係由一個管道監控,呢個管道會執行每個來源,記錄下 匯入工作,同埋 — 對第 7 節嚟講至關重要 — 報告成功。每次之後 匯入佢會刷新排名視圖(第5.5節),所以「天空」永遠都係 反映最新鮮嘅數據 [H] (劇本,2026年9月)。

6.2 The corpus today (measured)

Lexemes per live language (rounded, September 2026 audit)Japanese · jpn345k lexemesEnglish · eng271k lexemesGerman · deu176k lexemesSpanish · spa152k lexemesFrench · fra149k lexemesPortuguese · por145k lexemeslexemes in thousands (enrichment audit, rounded — Section 6.2)
Lexemes per live language (enrichment audit, 6 September 2026; rounded). Full SQL counts in Section 6.2.

2026 年 9 月 6 日 23 : 02 直接 SQL 測量實時資料庫 中部時間,2026年9月7日重新驗證(兩個計數相同) [H]

TableRows
concepts (meanings)96,434
lexemes (word forms)1,238,383
senses (word-dictionary meanings)1,608,018
relations (typed concept links)171,672
languages (live)6 — eng, spa, fra, deu, por, jpn

每種語言嘅詞彙權重(充實審計,2026年9月6日 [H] ):

LanguageLexemesSenses
Japanese (jpn)≈ 345,000≈ 528,000
English (eng)≈ 271,000≈ 393,000
German (deu)≈ 176,000≈ 203,000
Spanish (spa)≈ 152,000≈ 167,000
French (fra)≈ 149,000≈ 157,000
Portuguese (por)≈ 145,000≈ 160,000

呢啲數字旁邊有兩個誠實嘅警告。首先,每種語言嘅數字 係大約嘅(由審計四捨五入);表級別嘅 SQL 計數係 喺佢哋嘅測量嗰陣準確。第二,語料庫係 layered :有啲 數據集( kaikki Wiktionary 同字頻列表)係刻意嘅 每次匯入嘅上限係50,000行,而其他人會提供更深嘅覆蓋範圍 來源,而嗰個上限係有記錄嘅,而唔係隱藏嘅 [H] (審計,6 2026年9月)。第 7 節會顯示當類似嘅上限係 not 時會發生咩事 記錄咗做風險。

6.3 The API surface

呢個系統會暴露一個細嘅,刻意凍結嘅 HTTP API ( FastAPI ),佢嘅 ... 隨住新相嘅到來,0相表面被記錄為永遠唔會破裂 [H] (項目筆記,2026年8月29日)。端點,已經驗證喺入面 2026 年 9 月 [H]

  • /languages — 列出實時語言同佢哋嘅元數據;
  • /lexemes/concepts — 分頁清單查詢(限制/偏移,有上限

喺8月至9月嘅審計發現佢哋冇界限之後,每頁1,000個;

  • /analyze — 一個字嘅形態學/詞彙分析;
  • /kanji/lookup — 日文漢字同字典查找;
  • /graph/sky — 星圖資訊提供:按天空亮度排名嘅概念,同埋

搜尋參數( querylang ),深度( skip / 層),係咪要 附上成員字詞( words ),同埋一個 taxonomy lensanchorlens=up|down ),即係由一個給定嘅樹爬或者落 is-a 樹 概念;

  • /graph/star/{id} — 一粒星:每種語言嘅成員字詞同埋

佢嘅鄰居概念,兩者都係分頁嘅;

  • /graph/path — 兩個之間嘅有界圖搜尋(第5.3節)

概念;

  • /graph/word — 「字鏡頭」:畀咗一個字同一種語言,就係概念

佢嘅感官而家連結到。

所有回應都係壓縮嘅( gzip ),而每個查詢都係設計嚟執行 索引或者實體化嘅視圖 — 第5.6節嘅「有界工作」規則 [H] (代碼同實時標題,2026年9月)。

6.4 Why the design is language-agnostic in the database, not just on paper

讀者而家可以睇到成個循環。一種新嘅語言以一種 language 嘅形式出現 行(例如普通話,代碼 cmn )加埋註冊咗嘅數據集( OMW 普通話 wordnet ,一個 UD 普通話樹岸)。進口商會寫佢嘅詞素、意思同埋 — 喺 OMW 或者其他明確對應存在嘅地方 — 佢嘅意義 → 概念連結。 排名觀看次數會重新計算;天空得到一種新嘅語言;冇表格變動; 冇移民;喺 API 入面冇特別嘅情況。下一個家庭就係噉計劃 確切嘅路徑 — 普通話、廣東話、韓文同越南文 — 係喺 第10.3節,當中會決定數據可用性嘅偵察 佢嘅時間表係記錄咗 [H] (會議記錄,2026年9月7日)。個 設計嘅承諾 — 「無限期加入語言」 — 所以唔係市場推廣:佢 係架構嘅直接後果。

7 · Two infrastructure lessons: bake-don't-re-derive, and fail-loud

Query latency before and after the materialized-view patterndefault sky8.6s0.25ssky · 1,000 stars + words>60s1.1sper-request ranking0.5s0.02s
Query latency before and after the "bake, don't re-derive" materialized views (warm cache; 2014-era laptop).

每個資料庫項目最終都會遇到佢嘅性能牆。 Lingua Mundi 喺一個星期內遇到咗佢哋三個 — 然後發現最有趣嘅 問題唔係速度,而係靜音。呢個部分講兩個故事,因為 佢哋一齊係呢個項目最易轉移嘅工程課程。

7.1 The pattern: bake, don't re-derive

解決三個性能牆嘅規則好簡單,可以講出嚟 一句說話: 當好多查詢需要同樣昂貴嘅計算,計算 一次,儲存結果,同埋保持新鮮 — 唔好每次都重新計算 查詢。 喺數據庫方面, Lingua Mundi 使用 PostgreSQL 實物化 views :預先計算好嘅表格,佢哋嘅作用就好似充滿答案嘅索引噉。

  • Wall 1 — ranking the sky. 原本係要求預設星圖

迫使資料庫重新排名整個語庫 per request :大約 喺項目嘅2014年代手提電腦上面每次都係8.6秒。修正焗咗個 排入 concept_sky_rankconcept_lang_rank (94,498個同 ... 218,120個預先計算好嘅行),之後預設嘅天空就答咗入嚟 ~0.25秒同更深嘅請求,喺幾十毫秒 [H] (測量, 2026 年 9 月 6 號)。

  • Wall 2 — naming the stars. 求天 with its words

附加(每個概念每個語言嘅頂級字詞)需要喺1.6之間加入 每個要求都有百萬個感官;喺1,000粒星嗰陣,個查詢用咗多過 一分鐘 — 一個病理個案。修正咗啲字本身: concept_word_rank 預先計算每個概念每個前四個字 語言(創建嗰陣有338,378行),將一個分鐘加嘅聯接變成一個 ~ 1.1秒嘅查找,同埋預設嘅視圖變成 ~0.25秒嘅 [H] (測量, 2026 年 9 月 6 號)。

  • Wall 3 — hierarchy and pagination. 爬落去

分類學(鏡頭向上/向下)同埋透過穩定嘅星星窗口分頁係 用正規述語、索引排序同穩定分頁解決 窗口( DISTINCT ON 式查詢)而唔係圖表資料庫 — 月「精益堆疊」決定嘅回報(第4.5節) [H] (代碼同測量,2026年9月6日)。

每次匯入之後,視圖都會自動刷新,所以「焗」永遠唔代表 「過時」 [H] (脚本)。成個模式係一個數據庫原生實例 遊戲開發人員所謂嘅預算:貴嘅工作發生一次, 離開關鍵路徑,而用戶嘅請求只會讀取預先計算好嘅 答案。

7.2 The silent truncation that hid cat

喺2026年8月下旬,語料庫嘅英文層用 a 匯入咗 排帽,根本冇人打算做帽。監督緊嘅匯入 劇本將英文 Open Multilingual Wordnet 嘅進口限制喺 50,000 候選人 — and then reported success [H] (會議記錄,9月6日 2026年,根本原因條目)。英文 cat 係候選 number 52,195 入面 檔案嘅字母順序。佢被斷咗。大約 21,830個 117,659個英文合成集從來都冇創建過 ;為咗呢啲意思,英文 senses 係以原始字典條目嘅形式存在,但係從來都冇同概念連結過。 喺資料庫入面冇缺少 cat 呢個字 — 佢係 隱形嘅 map : 搵佢嘅意思搵唔到,因為意思節點 佢嘅感官應該係指從來冇建造過嘅 [H] (一樣 來源)。

大約六日,冇人知。作者關心嘅示範 — cat · gato · 貓 喺一粒星上面 — 用西班牙文同日文做嘢,但係用英文嚟講係空嘅, 而個空嘅結果就好似一個數據缺口噉 — 好似英文缺乏呢個字噉。 (記錄入面嘅一個計時筆記:多語言天空本身先至到達 當 integrate_core6.py 連結完附近嘅匯入語言嗰陣 月至 9 月嘅進口跑結束 — 之前嘅後備天空係一個 小單語言視野 — 呢個就係點解英文洞只係喺 月初,曾經嘅共享概念睇法其實係直播 [H] (會議記錄,2026年9月6日)。)作者自己嘅堅持,記錄喺 個工作階段記錄,係咪噉 呢個係 "not a data gap — infrastructure" [H] (工作階段記錄, 2026 年 9 月 6 號)。佢講得啱。失敗唔係喺數據入面,而係喺 管道嘅誠實:一個截斷嘅匯入已經報告咗成功,但係冇乜嘢 呢個系統係為咗注意到「成功」而設計,有50,000排嘅上限 52,195個候選人嘅失敗意味住。

7.3 The fix: an uncapped, idempotent repair chain

呢個修復 — 喺2026年9月6至7號設計同啟動,並喺2026年9月8號驗證完成(睇第10.1節) — 係一個點樣修復數據嘅模型 管道而唔會失去資料或者信任 [H] ( 脚本同工作階段記錄 , 2026 年 9 月 6 至 7 號):

  1. Re-import the English WordNet without the cap — 無能為力,所以一個

中斷跑可以簡單咁重新啟動,而唔使重複行;

  1. re-run the synset-to-synset relations 用嚟新建立嘅同步集;
  2. integrate :將新嘅合成集推廣到概念,連結成員感官 '

concept_id 欄位,同埋重新表達概念關係;

  1. refresh the materialized views 所以地圖反映咗修復咗嘅

語料庫;同

  1. verify end-to-end 有個接受脚本證明,由

資料庫同埋透過直播 API ,嗰個英文 cat 到達咗 國產貓概念 princeton-wordnet:02121620-n 連同其 多語言成員 — gatochatKatze — 同埋嗰個 概念有分類學父母。驗收檢查係設計嚟嘅 隨時重新跑,同埋大聲 PASS 或者 FAIL 退出。

因為每個步驟都寫成係幂等嘅(得到或創造, 跳過如果存在),一個機器喺維修中間崩潰,只係需要時間:個 鏈可以重新推出,並且會完成呢個工作。同一個財產保護 部分州嘅實時資料庫。

7.4 The lesson: fail-loud vs. fail-silent

cat 呢集係每個數據工程師都擔心嘅問題嘅教科書案例: a pipeline that fails silently and reports success. 方法論 教訓 — 行上限唔係成功標準,而進口商一定要咁做 驗證完整性,而唔係淨係完成 — 值得作為一般人講 開放數據基礎架構嘅原則,數據集係冇嘅 保證同管道係用手組裝。 Lingua Mundi 嘅回應係 以兩種形式制度化:任何未來嘅接受劇本 進口鏈可以運行,而工作室嘅常規規則係 未經驗證 聲明喺資料庫入面標記為未經驗證 — (保留咗孤兒感官 可見,連結上嘅信心水平)同埋每個書面記錄(個 本文嘅 [H] / [O] / [NV] 準則,附錄 A )。一個可以顯示嘅系統 佢嘅孤兒係一個可以搵到缺口嘅系統。一個隱藏佢哋嘅系統 係一個系統,佢嘅缺口會被發現 — 最終,由最差嘅可能 人:一個搵緊 cat 嘅用戶。

8 · The interface: a star map of meaning

單單係數據唔係產品。塑造咗 Lingua Mundi 嘅問題 介面好簡單: what should looking at a map of meaning feel like? 作者嘅答案,係透過2026年9月嘅第一個星期發展出嚟,係 應該係望住個天空嘅感覺 — 同埋,特別係,好似 虛構寶物星球嘅圖表:一張可以導航嘅宇宙紙質地圖 每隻星星都係一個想法,而語言就係你選擇嘅望遠鏡 透過 [H] 睇吓(工作階段記錄,2026年9月1至7日)。呢個部分 描述所產生嘅介面:佢嘅教育隱喻,佢嘅視覺 語言,佢嘅儀器,同埋工程學科,令所有人都可以 佢喺2014年嘅手提電腦上面運行。

8.1 From dictionary page to sky: naming the product

個介面喺兩個星期內經過三個身份,同埋個名 追蹤產品嘅演變 [H] (工作階段記錄,8月31日至9月6日 2026)。佢一開始係一個普通嘅字典頁面(「/gui/」,叫做 8 月 31 日天文台), 9 月 1 日成為 Planetarium ,成為 ... 數據匯入完成,然後出現咗一個星場可視化,然後 — 之後 作者睇咗個結果,發音星星「脚手架,唔係。」 產品」 — 喺9月6號晚旋轉成一個 語義圖 探險家:同一個天空,但係而家 the point 係意思,有節點 嗰啲係用你啟用嘅語言標記嘅概念,邊緣用嚟着色 關係家庭,同埋去模糊感官嘅搜尋。舊嘅天空景色係 保存咗但係冇連結;探險家成為咗 Lingua Mundi 嘅預設面孔 [H] (會議記錄,2026年9月6日)。

8.2 The pedagogical metaphor: an instrument, not a dashboard

介面嘅每個元素都會一對一映射到一個概念 天文學同埋嚟自語言項目本身 — 一個刻意嘅教育學 設計(比喻表係產品嘅內部文件) [H] (會議記錄,2026年9月6日至7日):

Star-map elementWhat it really is
A starA concept — one meaning, shared across languages
The stars' brightness (magnitude)A concept's lexical richness and connectedness (Section 5.5)
The language you look throughA telescope — the same sky seen in Spanish, English, Japanese…
Constellations and threadsFamilies of relations — the is-a taxonomy drawn as plotted course lines
Zooming inDescending from the wide sky to a single star and its neighborhood (the Hipparcos→Gaia idea — Gaia Collaboration et al. (2018): more detail the deeper you go)
The exposure dialDeepening the field — asking for more and dimmer stars around a focus
The sextantMeasuring a route between two meanings through the taxonomy
SkymarksBookmarks on stars
The word compassThe enabled languages, ringing the focused star as word chips
The course logYour exploration trail — how you arrived at this meaning

呢啲都唔係裝飾;引用咗作者對呢個工具嘅設計簡介 喺記錄入面,值得重複:個介面應該係 " 一個真實嘅 發現工具,而唔係玩具 " — 一個學習者或者所有語言嘅地圖 研究者可以真正探索 — 而佢嘅來源應該會好似一個噉嘅行為 可導航嘅紙質地圖,而唔係資訊主頁 [H] (會議記錄,9月6日 2026)。同樣嘅精神,儀表板都係刻意嘅 skeuomorphic :黃銅旋鈕曝光表盤,六分儀測量,圖表 課程,一個時代郵票 — 一個舊天文台嘅美學,揀咗嚟 用感覺教,而唔係用餐牌標籤教。

8.3 What is on screen

探索器,喺2026年9月端對端驗證 [H] ,提供:

  • Search with sense disambiguation. 輸入 gato (西班牙文)返回

意思 - 星星;每個結果都可以顯示邊啲語言共用邊啲字 意思 — 家貓明星嘅面板顯示佢嘅 多語言合集成員,例如英文 catgrimalkin ,德文 Katze ,日本 (第8.5節)。

  • Travel. 按一下星星(或者按住 Shift 按住 / 按測量鍵)就可以整到

佢係重點;天空重新集中喺佢身上,而佢嘅鄰近地區就會出現。

  • The star panel. 焦點明星嘅成員每種語言,佢嘅

定義,同埋佢嘅鄰近地區 — 同埋大型社區嘅分頁。

  • The taxonomy lens. 爬到一個明星嘅父母身邊(「呢個係咩一種。」

嘅? 正規嘅 is-a 家族述語。

  • The instruments (全部都係實時,已經驗證): exposure dial 擴大咗

以步驟為單位聚焦恆星場(90 → 180 → 360 → 720 → 1,000恆星), 合併更廣闊嘅天空而唔使重新旅行; sextant 測量 a 兩隻恆星之間嘅有界圖路徑(第 1 節嘅 /graph/path 搜尋 5.3),喺天空中畫一條虛線嘅金色路線,然後記錄每條腳; skymarks 釘星(喺本地持續,所以你自己嘅迷你星座 重裝時幸存; word compass 用字響聚焦嘅星星 晶片 — 每個啟用嘅語言都有一個,可以點擊嚟切換搜尋 語言;同埋 course log, home bearing, epoch stamp, and reticle 保持你嘅定位 [H] (會議記錄,2026年9月7日)。

  • The support affordance. 一個「 ✦ 支持」控制項會開啟捐款

模式(第10節)。

8.4 Engineering the sky on 2014 hardware

介面嘅美感係從屬於一個硬性約束:佢一定要運行 喺一部有2014年代處理器、8 GB RAM 同旋轉嘅機器上面順暢 磁碟 — 同一部托管資料庫嘅機器。製造嘅工程 呢個可能係值得記錄嘅,因為佢係同一個 bounded work 紀律如第 7 節,應用喺像素 [H] (審計同工作階段記錄, 2026 年 9 月 6 至 7 號):

  • The page renders only on input. 閒置 CPU 使用率係 ~ 0 % ;冇嘢

除非用戶做啲嘢,否則會動畫化。冇永恆嘅 動畫 — 喺「薯仔預算」下嘅刻意選擇(第9節)。

  • The nebula is baked. 裝飾背景(紫色/藍綠色/玫瑰色

花朵同塵埃)係每次調整大小畫一次,然後緩存,用 重新畫嗰陣嘅相機視差,而唔係每幅重新計算。

  • Labels are rationed. 每幅只係畫 ~24 個星星標籤 — a

標籤預算 — 保持重新畫平同埋文字清晰 [H] (個 介面代碼用 MAX_LABELS = 24 限制放置位置; gui/planetarium-v1.html )。

  • Requests are protected. 過時嘅回應令牌同埋中止控制項

當用戶繼續前進嗰陣取消飛行中嘅查詢;撳兩下延遲 單擊動作,噉就唔使浪費攞火;調整大小係去反彈同埋 畫布像素比例有上限(縮小調整大小嘅記憶體 1080p 時 ~ 24 MB 至 ~ 11 MB )。

  • Accessibility is explicit: 畫布角色同 aria 標籤,減少動作

支援,同埋鍵盤行程都係喺同視覺效果相同嘅過程中加入 波蘭 [H] (會議記錄,2026年9月7日)。

8.5 The demo that ties it together

呢個項目嘅示範係 cat 呢個字 — 或者更正確嚟講係 佢所屬嘅概念。喺探險家入面搜尋西班牙文 gato ,去到 星,而個面板顯示咗同步集 princeton-wordnet:02121620-n 同佢嘅 跨現場語言嘅成員。個子集實際上係端對端驗證 喺2026年9月6至7號嘅冇頭檢查入面記錄喺測試記錄入面 — 英文 cat, grimalkinfelis silvestris catus (學名 WordNet 店)、德國 Katze 、西班牙 gato 、日本 — 同埋個 ... 更廣泛嘅成員列出嗰個 synset 嘅資料庫儲存庫(例如英文 housecat, mouser, puss, tomcat ;法國 chat, chatte ;德國 Kater ; 日本 ネコ ;葡萄牙文 gato, bichano )嚟自匯入嘅字網 成員身份而唔係由端對端記錄;一個想要嘅讀者 完整嘅當前枚舉可以重新執行第7.3節嘅接受查詢 [H with [NV] on the untested tail] (冇頭 E2E 日誌同實時資料庫, 2026 年 9 月 6 至 7 號)。一粒星,六種語言,一種意思:2025年12月 直覺,喺螢幕上面睇到。呢個示威嘅英文方面係 正正就係第7.2節嘅錯誤短暫破壞咗嘅嘢:一架由西班牙人驅動嘅 gato 搜尋一直都係去到星星,而英文驅動嘅 cat 搜尋只係 喺覆蓋修復之後嘅工作,同埋第7.3節嘅驗收指令碼 存在正正係為咗證明,按需要, cat · gato · 猫 分享佢哋嘅 星星。

9 · The workbench: tools, workflow, and the "potato" machine

如果冇咗佢建立嘅工作台,項目歷史就唔完整。 Lingua Mundi 嘅工作台係唔尋常嘅,而佢所施加嘅約束亦都塑造咗 呢篇文章入面幾乎每個工程決定。

9.1 The potato

托管資料庫嘅機器、 API 、接口同埋 開發環境係一部消費型手提電腦:一部 華碩 X751MA 同 一個英特爾奔騰 N3540 (Bay-Trail, four cores, no AVX2), **8GB 內存 (7.6 GiB 可用),一個 5400 rpm hard disk ,同埋一個互聯網上行鏈路 大約係 47 KB/s — 呢篇論文喺2026年9月7號現場拍攝 (部機本身有 [H]lscpu / /proc/meminfo )。個項目嘅 筆記將呢部同一部機用唔同嘅方式描述為原子 Z36xx / Z37xx 或者一個 奔騰 N3540 — 同一個灣徑矽系列,但係唔同名稱 [O] ; 2026年較早嘅聊天記錄亦都參考咗唔同嘅個人檔案 (一部英特爾賈斯珀湖「 N5105」機器),第10.2節將佢列為一部 未解決嘅硬件記錄衝突。工作室叫現場箱,用 感情, the potato — 而且佢設定咗一個規則,出現喺整個 記錄: one heavy operation at a time ,記憶保護包裝,冇永久 動畫,冇過早嘅基礎設施(第4.5節),同埋每份重工 以自我警示嘅獨立脚本形式執行,而係報告完成嘅時候 比起被調查嘅 [H] (會議記錄同工具,2026年9月)。個 「焗,唔好重新衍生」模式(第7節),只係輸入介面 (第8.4節),同埋零 LLM 成本嘅研究表面(第9.4節)全部都係, 喺底部,薯仔嘅後果 — 證明緊嘅預算可以係一個 設計美德而唔係限制。

9.2 The software stack

跑緊嘅系統(現場驗證,2026年9月 [H] ): PostgreSQL 16 作為單一數據庫(第4.5節), FastAPI ( Python )作為 API 層, SQLAlchemy + Alembic 用於模型和轉移, Python 脚本 對於進口商同物化視野管理,同埋一個小 冇依賴嘅網絡介面( HTML / CSS / JavaScript )由同一個提供 起源。輔助機械包括 systemd 用戶服務,用嚟保留 API 同埋記憶體 / 熱保護器活住(第9.5節),每日 GitHub 代碼庫嘅備份,一個黑曜石知識庫作為項目記憶體 (第9.3節),冇頭 -Chromium 端對端檢查接口,同埋 工作室嘅 detach-run + notify 工具,用嚟自我警示背景 工作 [H] (服務同工具庫存,2026年9月)。

9.3 The knowledge base: a project memory that can be audited

由2026年8月26日起,作者同佢嘅代理人維持咗一個有結構嘅 知識庫 ( 黑曜石保險箱 ) , 每個工作會議都係喺呢個庫入面 記錄咗:完成嘅工作、所做嘅決定、下一步行動,同埋每個行動嘅檔案 事實嚟自,有正面嘅記錄來源同埋一個 verified: true/false 旗號 [H] (保險箱大會,2026年8月至9月)。個 保險箱係呢篇文章可以引用日期同引號嘅原因:當呢個 草稿話「會議記錄,2026年9月6日」,係指向一個檔案 存在,係嗰日寫嘅,同埋有佢自己嘅來源筆記。兩個 嗰個保管庫嘅慣例值得一提,因為佢係 method :每個聲稱都係 應該講明佢嘅來源,而歷史從來都唔係發明嘅 — 未經證實 材料被保留,但係標記為未經驗證嘅 [H] (保管庫準則)。嗰啲 慣例係本文嘅慣例(附錄 A )。

9.4 Zero-token research and the local-first rule

作者嘅常規 — 喺2026年8月29號嘅項目筆記入面睇到 — 即本地 API is 個研究面: /lexemes/concepts/analyzezero LLM tokens 回答有關語料庫嘅問題 用咗 [H] 。同樣嘅本地第一本能控制數據(所有嘢 自主托管;冇嘢取決於供應商),錢(免費層級同開放數據 只係;第10節),同埋私隱(秘密永遠唔會離開機器; 知識庫係私人嘅) [H] (會議記錄,2026年9月)。

9.5 Guardrails on a fragile machine

因為個薯仔冇頭位,所以個工作室整咗個護欄,即係 佢哋自己係工程故事嘅一部分:一個 memory/thermal guardtools/mem-manager.sh ,第2版,2026年9月7日直播)喺下面警告 900 MiB 可用記憶體或者 80 °C 同埋棚可選背景 500 MiB88 °C 以下嘅單位,加埋一個系統級別嘅 早 殺手 earlyoom -m 8 -s 5 ,即係當空閒記憶體崩潰嗰陣佢會起作用 低於 8% ,步頻為 5 秒) [H] (現場配置: mem-manager.sh 閾值同 /etc/default/earlyoom ,讀9月7號 2026)。工作室嘅營運規則保持 嗰啲護欄永遠唔使行動: one heavy operation at a time , 記憶保護嘅包裝器,同埋所有嘢嘅自我警示獨立工作 長跑。長修係寫成 idempotent (得到或創造, 跳過如果存在)噉樣任何中斷 — 重新啟動、斷電、守護 旅行 — 除咗時間之外,冇其他費用:維修可以簡單噉重新啟動,而且會 完成呢份工(第7.3節)。同一個學科處理並發本身 作為要預算嘅資源,例如記憶體或者磁碟。

9.6 Governance: licenses, attribution, and the "free forever" decision

喺 Lingua Mundi 入面輸入嘅每個數據集都記錄咗佢嘅授權( 存儲庫嘅 docs/DATA_LICENSES.md 庫存;實時資料庫嘅 source 表) [H] : WordNet (允許),即 Open Multilingual Wordnet (每種語言嘅授權,主要係 CC BY-SA 同 CC BY ), Wiktionary 同 開基( CC BY-SA ,有 GFDL 舊式)、 Wikidata ( CC0 )、 UniMorph (CC BY-SA 3.0), Universal Dependencies (CC BY-SA 4.0), JMdict/KANJIDIC2 和 EDRDG 家族(允許,有歸因)、 OPUS (每個數據集)、 CLICS 同埋字頻清單(每個來源),等等 [H] (授權庫存, 喺2026年9月存取)。項目互相回報:佢自己嘅輸出係 亦都計劃免費。

funding model 係遲咗九日公開進化出嚟 2026年8月/9月初,而記錄顯示每個步驟 [H] (會議 日誌同日曆,2026年8月29日至9月7日):一個賣出一個嘅初步計劃 離線 Core-6 字典應用程式( Texupan ,每月29美元或9美元)喺8月29日;一間商店 喺9月1日前喺 store hub 上面列出同付款連結;同埋 — 喺9月7號之前 — a 決定做 Lingua Mundi free forever ,由自願資助 捐款,而 Stripe 產品嘅字面名係 " Lingua Mundi — 保留佢 永遠免費」 ,一次性價錢係 € 5 / € 15 / € 50同每月 € € 3 / € 9 / € 25,同埋一個 誠實嘅年度目標係 €2,400 覆蓋基礎設施同下一個 語言嘅數據工作 [H] (會議記錄,2026年9月7日)。個帳戶 係刻意設定咗 dormant — 捐款停用,直至作者為止 完成付款供應商嘅身分驗證 — 噉樣「免費 永遠」,喺作者嘅框架入面,係一個 verifiable claim ,而唔係一個口號 [H] (會議記錄,2026年9月7日)。身份驗證喺2026年9月8日完成,而六個付款連結喺嗰朝上線;佢哋會喺店舖嘅資金部分 [H] ( Stripe 帳戶記錄同付款連結記錄,2026年9月8日)發佈。面向公眾嘅文字係跟住嘅 工作室聲音規則(前面嘅事)同誠實抄襲規則:冇炒作,冇 過度聲稱 — 同管理資料庫同呢篇論文嘅學科一樣。

10 · Where the project stands (7 September 2026), its honest limits, and its road ahead

10.1 Current state of the system

喺2026年9月6至7日 [H] 直接對住實時系統測量(睇 附件 A 提供確切嘅查詢):

  • Corpus (pre-repair snapshot, 6–7 September 2026): 96,434個概念 · 1,238,383個詞組 · 1,608,018個感覺 · 171,672個關係,用六種活語言(英文、西班牙文、法文、德文、葡萄牙文、日文) — SQL 計數喺兩個測量日期都係一樣咁重現。
  • Corpus (post-repair, 8 September 2026): 125980個概念 / 125980個同義詞 / 352333個英文詞組,如修復報告所記錄( lm-en-coverage-REPORT-2026-09-08.txtRESULT: PASS ); cat 明星 princeton-wordnet:02121620-n 嘅多語言成員包括英文、西班牙文、日文、德文同葡萄牙文(貓、加托、貓、卡茨、加托家庭)。
  • Ranking views: concept_sky_rank 94,498列; concept_lang_rank

218,120排; concept_word_rank 創建時有338,378行(即時重新計數 被拒絕標準資料庫角色;標記為 [NV] )。

  • Performance: 預設天空 ≈ 0.25秒溫暖(排名前8.6秒

景色);深度 1,000 星查詢,字詞 ≈ 1.1秒(字前 >60秒 風景);以毫秒計嘅圖表路徑搜尋;搜索 ≈ 0.5秒溫暖 / ≈ 10秒 硬碟嘅頁面快取係冷嘅。

  • Interface: 語義圖探索器喺 API 嘅網絡起源,同

所有儀器(曝光表盤、六分儀、天標、字指南針、當然 日誌,時代印章)由23/23冇頭瀏覽器端對端檢查驗證 2026年9月6至7號。

  • English coverage repair: 未封頂嘅英文 WordNet 重新匯入、關係、整合、檢視刷新同端對端驗證鏈(第7.3節)喺2026年9月7日上午啟動,並喺2026年9月8日22:19(2026-09-0822:19:佢嘅接受閘通過咗:連鎖店自己嘅報告( lm-en-coverage-REPORT-2026-09-08.txtRESULT: PASS )記錄咗 princeton-wordnet:02121620-n 上嘅概念連結英文 cat 感,佢嘅多語言成員包括貓、加托、貓、卡茨、加托家庭 [H] (報告,2026年9月8日)。
  • Governance: 捐款頻道直播 — 2026 年 9 月 8 日完成身份驗證,六條付款連結發佈於店內;

作者嘅付款供應商驗證;每日備份嘅代碼庫; 知識庫當前。

10.2 What is honestly not known, and what is unresolved

工作室嘅驗證準則要求呢篇論文講清楚啲咩 佢驗證唔到,同埋記錄唔到來源之間嘅矛盾。個 重要嘅:

  1. The "Core 6" discrepancy. 作者個人語言集(已錄音

2026 年 8 月 29 號)係西班牙文、英文、日文、法文、 Italian ,同埋 葡萄牙文。實時資料庫嘅六種語言係英文、西班牙文、 法文、 German 、葡萄牙文同日文。德文取代咗意大利文 冇現存嘅書面解釋嘅資料庫;意大利語 row 同意大利資料集係早啲註冊,但係實時表係保留嘅 德國 [H] 同原因 [NV] (亦睇第4.2節關於嘅 規格嘅層次,包括普通話同意大利文,但唔包括德文 — 三個月內三個唔同嘅出版語言集)。

  1. Corpus-count drift within a single day. 寫咗嘅技術檔案

2026年9月6號報告1,146,066個詞素 / 1,595,537個意思,而 直接 SQL 同晚報1,238,383 / 1,608,018(概念同 關係相同:96,434/171,672);嗰個嘅工作階段記錄係一樣嘅 晚上帶有第三個中間數字( ≈ 115萬個詞組), 同全日仍然落地嘅進口一致。每種語言嘅總和 同 SQL 圖調和,所以檔案嘅數字似乎係來自 唔同嘅時刻或者過濾器;呢個差異係無法解釋嘅 記錄 [H] 同對帳 [O] 。呢篇文章引用咗 SQL 數字同佢哋嘅日期。

  1. Hardware records conflict. 托管實時系統嘅機器

2026 年 9 月係直接為呢篇論文拍攝,係華碩 X751MA 配備英特爾 Pentium N3540 (灣仔), 8 GB RAM (第 9.1 節) [H] 。書面記錄比較亂:項目筆記描述咗個框 作為英特爾原子灣步道( Z36xx / Z37xx )同埋作為奔騰 N3540 — 嘅 同一個矽代以兩個營銷名稱 [O] — 而早啲 2026年嘅對話記錄參考咗一部唔同嘅機器,一部英特爾 Jasper Lake "N5105" 配備 12 GB RAM (2026 年 1 月),之後就係 「一個賈斯珀湖4晶片」(2026年5月)同「英特爾賈斯珀湖 N5105,4 GB 」 (2026年中記憶檔案)。賈斯珀湖唔係灣徑矽,所以個 記錄描述咗一年入面兩部唔同嘅機器,或者 助理標籤錯誤;現存嘅證據唔可以決定邊個,同埋 個點係喺呢度標記,而唔係用 [H] 平滑 對帳 [NV] (會議記錄同 AI 對話記錄, 2026 年 1 月至 9 月)。

  1. Data-quality warnings from the September audit: 語料庫包含

178,576個重複嘅引理對; 124,790個冇意義嘅詞組; 33.9 % 嘅 定義係空嘅;同埋(喺英文修復之前)71.7 % 嘅感官仲未 連結到概念。同一個審計發現有參考完整性 整個過程(喺資料庫級別嘅總和,零掛掛/孤行行): 71.7 % 嘅數字描述咗感官 not yet linked to a concept ,即係 設計咗可見嘅孤兒狀態,而唔係破碎嘅參考資料 — 一個誠實嘅 喺對齊工作嘅時候,項目刻意保持可見性 繼續 [H] (審計,2026年9月5日至6日)。

  1. Unmeasured or pending: 係薯仔以外嘅硬件上面嘅性能

從來都冇測量過;呢個項目仲未有公開用戶,所以有 冇實際使用數據;工作室嘅法律結構冇記錄喺 記錄; 「兩韓」建模問題,廣東話數據稀缺, 同埋台灣嘅 wordnet 授權審查係開放嘅(第10.3節)。

10.3 The road ahead

呢個路線圖喺2026年8月29號獲得用戶批准,係6月嘅成熟形式 手稿嘅七個圖表 [H] (項目筆記):音譯/音系學, 形態學(匯入)、語法(匯入)、語義(匯入)、詞典學 (匯入)、語料庫(匯入)同埋 — 排隊 — 論述、語源同埋 對應同使用層,加上最終嘅公開網絡介面。喺 近期嘅文件化計劃係 [H] (會議記錄,9月7日 2026):

  • The CJKV family. 計劃用嚟做架構嘅下一個語言係

普通話( cmn )、廣東話( yue )、韓文( kor )同越南話( vie )。佢哋嘅 時間表取決於誠實嘅數據可用性侦察 關於開放數據環境提供嘅嘢: OMW Wiktionary 字網存在 普通話(19,079行)、廣東話(527行)、韓文(9,268行)同埋 越南文(5,498); UD 樹岸用普通話(123k 代幣),廣東話 ( 14k ),韓文(80k GSD 加350k Kaist ),越南文(58k)。廣東話係 稀有嘅 — 冇大嘅字網,細嘅樹岸 — 同埋台灣人 wordnet 授權正喺審查中 [H] ( 工作階段記錄同資料 庫存,2026年9月7日)。冇將任何 CJKV 數據集匯入到 截至呢份草稿嘅實時語料庫;家庭嘅時間係一個公開嘅決定 等緊嗰個審查。

  • Research-v1 interface panes ( 字鏡頭、血統攀登、野外卡、

筆記本、比較表)喺6號設計同後端批准 2026年9月又排喺儀器砌 [H] 後面。

  • Publication. 本文係由人工智能生成嘅初步草稿;個

人類撰寫嘅出版物正喺開發中(前面嘅事)。

  • Languages without end. 架構嘅承諾 — 加入一種語言作為語言

行加資料集 — 係項目所述嘅長遠目標,同埋 捐款推銷講得好清楚: Lingua Mundi 由六種語言開頭, 建立咗嚟無限期加入佢哋 [H] (會議記錄,2026年9月7日)。

10.4 Conclusion

喺2025年12月3號開始嘅免費字典檔案嘅要求,而家已經係 一張可以運行嘅、可查詢嘅、六種語言嘅意義地圖,係建立喺開放數據上面,由一個人建立 有免費工具同一部2014年手提電腦嘅人。帶住佢嘅想法 — 即係 意義係多語言數據嘅自然單位;嗰個對齊一定係 明確同標籤,從來唔會默默估到;嗰個貴嘅計算 應該焗一次同睇好多次;預算限制係 a 設計工具;每個主張,無論係喺資料庫定係喺論文入面,都應該有佢嘅 來源同佢嘅日期 — 唔係新嘅,但係佢哋係 true ,同埋個項目 證明一個人可以對佢哋採取行動。佢最有價值嘅神器可能係 根本唔係個數據庫,而係一個獨立研究者可以做到嘅示範 喺公眾場合建立誠實嘅基礎設施:衡量佢衡量嘅嘢,拍拖 佢拍拖嘅嘢,畀佢啲孤兒睇,同埋守佢嘅話 — 一粒星,六粒星 語言,而成個天空仲係前面。

Built in a cave, with a bunch of scraps.

References

APA 第七版。參考文獻詳情已經根據出版商頁面驗證 同埋2026年9月7號嘅數碼物件識別碼記錄。軟件同數據 來源係按 APA 嘅軟件/資料集格式引用。 (只係引用喺 文字已經列出嚟。)

邦德, F . , & 福斯特, R . (2013)。連結同擴展開放式多語言 字網。喺 協會第 51 屆年會嘅論文集入面 計算語言學 (頁1352-1362)。計算協會 語言學。 https://aclanthology.org/P13-1133/

美國盲文研究所。 (2019)。 Atkinson Hyperlegible [ 電腦 字體]。 https://brailleinstitute.org/freefont

布林,傑 · 威爾(2004)。 JMdict :日文多語詞典。喺

  • 多語言語言資源研討會( COLING

2004)*(第65至72頁)。柯林。 https://aclanthology.org/W04-2209/

電子詞典研發組。 (日期)。 JMdict / EDICT 日英字典項目 [ 資料檔案同文件 ] 。 喺2026年9月7號喺 https://www.edrdg.org/jmdict/edict_doc.html 度搵到

費爾鮑姆, C . (編)。 (1998)。 WordNet: An electronic lexical database 。麻省理工學院 按。 https://mitpress.mit.edu/9780262561167/wordnet/

蓋亞合作,布朗, A . G . A . ,瓦萊納里, A . ,普魯斯蒂, T . ,德布魯伊內, 傑 · 赫 · 傑,巴布西奧, C . , ... 茲維特, T . (2018)。蓋亞數據發佈2:摘要 嘅內容同調查屬性。 Astronomy & Astrophysics, 616 , 第 A1 條。 https://doi.org/10.1051/0004-6361/201833051

赫南德斯, R . (2026年,6月1日)。 Lingua Mundi :一個語義基礎架構 概念基礎嘅語言模型 (第1至7版)[未出版嘅稿件; 修訂同審計記錄保存喺作者嘅對話記錄入面 封存檔案]。

赫南德斯, R . (2026年7月24日)。 多語言詞彙平台 — 工程 規格 (2.0版本)[未出版嘅規格文件;文字 檔案中嘅提取]。

基洛夫, C . ,科特雷爾, R . ,西拉克 - 格拉斯曼, J . ,沃爾瑟, G . ,維洛莫瓦, E . , 夏, P . ,法魯基, M . ,米爾克, S . J . ,麥卡錫, A . ,庫布勒, S . ,雅羅夫斯基, D . , 艾斯納, J . , & 哈爾登, M . (2018)。 UniMorph 2.0:通用形態。喺

  • 第十一屆國際語言資源學術研討會論文集

同埋評估( LREC 2018) * 。歐洲語言資源協會。 https://aclanthology.org/L18-1293/

麥卡錫, A . D . ,基羅夫, C . ,格雷拉, M . ,尼迪, A . ,夏, P . ,戈爾曼, K . , 維洛莫瓦, E . ,米爾克, S . J . ,尼古拉, G . ,西爾夫伯格, M . ,阿坎格爾斯基, T . ,克里扎諾夫斯基, N . ,克里扎諾夫斯基, A . ,克利亞奇科, E . ,索羅金, A . , 曼斯菲爾德, J . ,恩什特雷茨, V . ,品特, Y . ,雅各布斯, C . L . ,⋯雅羅夫斯基, D 。 (2020)。 UniMorph 3.0:通用形態。喺 第十二屆論文集入面 國際語言資源同評估會議( LREC 2020) (第3922至3931頁)。歐洲語言資源協會。 https://aclanthology.org/2020.lrec-1.483/

梅耶, C . M . , & 古雷維奇, I . (2012)。 Wiktionary :新對手 專家建立嘅詞典?探索協作嘅可能性 詞典學。喺 S. 格蘭傑同 M. 帕科特(編), Electronic lexicography (第259至292頁)。牛津大學出版社。 https://doi.org/10.1093/acprof:oso/9780199654864.003.0013

米勒,佐治亞州(1995)。 WordNet :英文嘅詞彙資料庫。 Communications of the ACM, 38 (11),39-41。 https://doi.org/10.1145/219717.219748

尼夫雷, J . ,德馬內菲, M . - C . ,金特, F . ,哈吉奇, J . ,曼宁, C . D . , 皮薩洛, S . ,舒斯特, S . ,泰爾斯, F . , & 澤曼, D . (2020)。通用 依賴關係 v2:一個不斷增長嘅多語言樹庫集合。喺

  • 第十二屆國際語言資源學術研討會論文集

同埋評估( LREC 2020) * (頁4034-4043)。歐洲語言資源 協會。 https://aclanthology.org/2020.lrec-1.497/

普林斯頓大學。 (日期)。 About WordNet 。 WordNet 。喺九月擷取 2026 年 7 月,來自 https://wordnet.princeton.edu/

SIL 國際。 (日期)。 ISO 639-3 。喺2026年9月7號檢索,嚟自 https://iso639-3.sil.org/

德索索,弗(1983)。 Course in general linguistics ( C . 巴利, A 。 塞切哈耶, & 阿 · 里德林格,編;哈里斯,譯者)。達克沃思。 https://www.bloomsbury.com/us/course-in-general-linguistics-9781472508829/ (原著出版於1916年)

斯皮爾, R . (2022)。 wordfreq :好多字頻率嘅資料庫 語言 (3.0版本)[電腦軟件]。 GitHub 。 https://github.com/rspeer/wordfreq

蒂德曼, J . (2012)。 OPUS 入面嘅並行數據、工具同介面。喺

  • 第八屆國際語言資源學術研討會論文集

同埋評估( LREC 2012)*(第2214至2218頁)。歐洲語言資源 協會。 https://aclanthology.org/L12-1246/

弗蘭德奇奇, D . , & 克羅茨, M . (2014)。 Wikidata :自由合作 知識庫。 Communications of the ACM, 57 (10),78-85。 https://doi.org/10.1145/2629489

維基媒體基金會。 (日期)。 Wiktionary: The free dictionary 。擷取咗 2026 年 9 月 7 日,來自 https://www.wiktionary.org/

Zipf, G. K. (1949). Human behavior and the principle of least effort. Addison-Wesley Press. https://archive.org/details/humanbehaviorpri0000zipf

Appendix A · Sources, method, and verification

A.1 The annotation convention

遵循工作室嘅嚴格標準(繼承自佢嘅調查 工作),呢篇文章入面嘅聲稱會喺讀者需要知道嘅地方標記 認知狀態: [H] = 已經驗證嘅事實 — 一個測量、代碼或者日期 呢篇論文嘅來源; [O] = 歸因解釋或者 意見; [NV] = 未驗證/未定位。摘要入面嘅每個數字 而機身係一個帶有日期嘅 [H] 測量值,或者係有標籤。

A.2 Source families consulted (access 6–7 September 2026)

#SourceWhat it provided
1Live codebase: …/SafeMode/Software Development/LinguaMundi/lingua-mundi (api/, core/, schemas/, importers/, scripts/, docs/, gui/)Architecture, schema, importers, materialized-view SQL, API routes, GUI code
2Live database lingua_mundi (PostgreSQL, 127.0.0.1:5433), direct SQLCorpus counts, language table, synset membership, concept links
3Live API (127.0.0.1:8765): /languages, /graph/sky, /graph/star, /graph/word, /graph/path, /openapi.jsonEndpoint behavior, warm/cold latencies, gzip
4Web interface (127.0.0.1:8765/gui) + headless-browser checksUI behavior; 23/23 end-to-end checks recorded 6–7 Sep 2026
5Vault knowledge base (session logs 26 Aug–7 Sep 2026, handoffs, project notes, conventions)Milestones, decisions, quotes, conventions, dates
6ChatGPT conversation archive (export 5 Sep 2026; 421 conversations with content)Origin and growth conversations, verbatim quotes (Section 1, 3, 4)
7DeepSeek data export (6 Sep 2026; 215 conversations)June 2026 manuscript revision cycle, setup logs
8Claude.ai data export (extracted 6 Sep 2026; legacy-memory file updated 7 Sep 2026)Long-horizon context, project roles
9Personal artifacts in the author's home directory (file timestamps, scripts, specification PDF, journals)Pre-project chronology (Nov–Dec 2025), engineering specification, journals
10Published scholarly and data sources (see References)Background and related work

代表性驗證查詢(喺2026年9月7號執行,角色 lingua ): SELECT count(*) FROM concept|lexeme|sense|relation → 96,434 / 1,238,383 / 1,608,018/171,672; SELECT code FROM language → deu 、 eng 、 fra 、 jpn 、 por 、 水療中心;每個語言嘅合成集 02121620-n 嘅成員身份(第8.5節);個 項目自己嘅接受脚本 verify-lm-cat-demo.sh ( 第 7 節 ) 。

A.3 Key numbers with dates (compressed timeline)

DateEvent / figure
2025-11-11KANJIDIC2 downloaded (first dataset, file timestamp)
2025-12-03Origin message: "unified multilingual database" (ChatGPT log)
2025-12-05OMW data downloaded; first extract scripts
2025-12-08…16Merge/unified pipeline; four-entity (concept/sense/lexeme/grapheme) JSONL schema
2026-05-01OMW v2.0 coverage study
2026-05-23"Multilingual Lexical Platform" spec master (markdown)
2026-06-01Lingua Mundi named; manuscript V1–V7 revision cycle (DeepSeek + ChatGPT audits)
2026-07-17/18Code scaffolding; feasibility conversation; journal
2026-07-24Engineering Specification V2 (104 pp., PDF)
2026-08-13Lean-stack decision; semantic interaction layer
2026-08-19…25Japanese demo builds; 23 Aug concept descriptions
2026-08-27Daily GitHub backups begin
2026-08-29"LinguaMundi IS the lexicon" decision; roadmap approved; Core 6; Postgres live; UD importer
2026-08-30API routes (CORS, /lookup, /kanji); 27 tests green; first /gui deploy
2026-08-31Import restart (~1.13M rows); English OMW cap seeded the cat bug
2026-09-01Planetarium naming; ≈1.54M rows; store live
2026-09-05Deep audit; pagination fixes; 1,238,383 lexemes
2026-09-06Enrichment audit; materialized-view overhaul (94,498 / 218,120); words bake (338,378); GUI pivot to semantic-graph explorer; cat root cause; research-v1 approval
2026-09-07Instruments live (23/23 E2E); donation setup (dormant); English coverage repair chain launched; CJKV data-availability reconnaissance; this paper drafted
2026-09-08English coverage repair verified complete (8 September 2026 at 22:19); acceptance gate PASS recorded in lm-en-coverage-REPORT-2026-09-08.txt

A.4 Contradictions and unresolved items

如第10.2節所述:意大利 / 德國 Core-6 嘅差異;個 同日語庫計數漂移(檔案1,146,066對 SQL 1,238,383個詞組, 喺同一晚嘅會議記錄入面有第三個中間數字, 每種語言同 SQL 圖調和;硬件記錄衝突 (原子灣徑對奔騰 N3540對賈斯珀湖 N5105喺2026年初 記錄 — 第10.2節第3項); 71.7 % 嘅無連結感覺同埋 其他數據質素警告;同埋未經驗證/冇文件嘅項目:確切 repo 創立日期係 8 月 26 日前,語言集變化嘅原因 , 6 月 1 號審計文本嘅模型來源(審計喺 作者喺用戶方面嘅 ChatGPT 對話;邊個助理型號 寫咗邊個審計輪喺出口入面冇獨立證明 — 睇第3.3節), concept_word_rank 實時重新計數(被拒絕許可), 同埋工作室嘅法律結構。

A.5 Methodology notes

  • 被測試嘅系統 is 係生產系統;溫暖嘅測量帶

±0.3秒硬碟噪音;日期同時間係記錄入面畀嘅 時區(除非有註明,否則係中部時間; DeepSeek 記錄使用 + 08:00,而且係 轉換咗)。

  • 引用係逐字嚟自引用嘅記錄/檔案;椭圓標記切割;

西班牙文引號係用英文嘅光澤喺正文入面畀出嚟。

  • 呢篇論文本身係一個由人工智能生成嘅草稿(前置通知);佢係

喺作者嘅指示下,由上面嘅來源寫出嚟,而冇 已經經過同行評審。驗證工具:直接 SQL , HTTP 查詢, 冇頭瀏覽器檢查,同埋源檔案讀取;冇收到任何申索 當個來源存在嗰陣嘅記憶。

Appendix B · Glossary — plain-language terms used in this paper

How to use this glossary: the first time a technical term appears in the paper it is underlined with dots — hover it (or tap it) for a quick definition, or click it to jump here. This list is alphabetical.
  • Alignment — 決定一種語言嘅字同另一種語言嘅字嘅意思係一樣嘅行為。
  • API — 一個介面,畀一個程式向另一個程式要求資料(例如,字典應用程式向 Lingua Mundi 資料庫要求一個字)。
  • Autonym — 一種語言嘅使用者叫佢嘅名(講西班牙文嘅人叫西班牙文 español )。
  • Bake — 項目嘅詞語,用嚟計算一次貴嘅答案,儲存佢,同埋讀好多次(工作規則係「焗,唔好重新推導」)。
  • Breadth-first search — 一種分層向外探索圖表嘅方法,就好似石頭嘅波紋噉,搵兩個點之間嘅最短路線。
  • CJKV — 跨越中文、日文、韓文同越南文嘅寫作系統家族嘅簡寫(字母代表劇本名稱)。
  • Concept — 一個意思,跨語言共享(喺呢篇文章入面,係「家貓嘅想法」,而唔係任何特定嘅字)。
  • Corpus — 大量用作證據嘅語言資料(文字或者字典條目)。
  • Dataset — 一個來自一個來源嘅打包資料集合,並且有自己嘅格式同授權。
  • Derivation / etymology — 派生係點樣由現有嘅字建立新字(跑 → 跑手);語源係一個字跨越時間同語言嘅歷史。
  • ETL — 提取 - 轉換 - 載入:從外部來源讀取資料,重新塑造佢,然後將佢儲存喺資料庫嘅過程。
  • FastAPI — 一個免費嘅開放源碼 Python 框架,用嚟構建呢個項目所服務嘅介面( API )。
  • Full-text search — 透過匹配儲存文字入面嘅字詞而唔係用確切嘅識別碼嚟搜尋資料庫。
  • Grapheme — 一個書面字母:字母表嘅字母、音節符號或者漢字。
  • Graph — 喺呢篇文章入面,一組由類型關係(邊緣)連接嘅意思(節點)。
  • Gzip — 一種標準壓縮方法,喺檔案透過互聯網傳播之前,可以令檔案變細。
  • HTTP — 網絡瀏覽器同 API 用嚟透過互聯網要求同接收資料嘅協定。
  • Hypernym / taxonomy — 上位詞 = 「一種」: felinedomestic cat 嘅上位詞。分類係所產生嘅種類樹。
  • Importer — 一個識得讀取一個外部數據集,然後將佢寫入 Lingua Mundi 自己嘅架構嘅程式。
  • Index — 一個資料庫結構,令查詢可以快速搵到行,就好似書籍嘅索引噉,而唔係睇每一頁。
  • Inflection / morphology — 彎曲係改變字嘅文法形式(跑 → 跑);形態學係對嗰啲形式嘅研究。
  • Instance-of / part-of — 圖表中有兩種關係類型:「呢個係嗰個嘅一個例子」(貓係哺乳動物種類嘅一個例子)同埋「呢個係嗰個嘅一部分」(爪子係貓嘅一部分)。
  • Interlingua — 語言之間嘅共享中間表示:唔使直接翻譯西班牙文 → 英文,而係去西班牙文 → 意思 → 英文。
  • ISO 639-3 — 國際標準,為每種人類語言指定一個獨特嘅三個字母代碼( spa = 西班牙文, jpn = 日文)。
  • JMdict / KANJIDIC2 — JMdict 係一個大型嘅日語多語言字典; KANJIDIC2 係佢嘅漢字(日文用嘅中文字)嘅伴侶檔案,有讀法同意思。
  • JSON Lines — 簡單嘅文字格式,每行都係一個資料記錄,用嚟項目最早嘅管道檔案。
  • Kaikki — 機器可讀嘅 Wiktionary 資料提取,程式比原始頁面更容易讀取。
  • Kanji — 喺寫日文入面用嘅中文字。
  • Lemma — 字詞嘅字典形式(你搵嘅形式: cat ,唔係 catsrun ,唔係 ran )。
  • Lexeme — 特定語言嘅字形(字串 cat )。
  • License — 法律條款,講明點樣可以用同分享資料; 「開放」授權允許重複使用並歸因(例如 CC BY-SA )。
  • Long tail — 喺齊普夫分佈嘅遠端嘅大量稀有物品(睇 Zipf 定律)。
  • Materialized view — 儲存咗嘅預先計算好嘅查詢結果,按時間表刷新,所以重複嘅問題唔會重做工作(「焗」模式)。
  • Morphology — 研究字形同埋佢哋點樣改變文法(睇彎曲)。
  • Natural language — 人類嘅語言,就係人哋實際講同寫嘅語言,而唔係編程語言。
  • Node / edge — 喺圖表入面,節點係一個項目(呢度係一個概念),而邊緣係兩個項目之間嘅連接(呢度係一個類型關係)。
  • OMW / Open Multilingual Wordnet — 同英文 WordNet 對齊嘅字網集合。
  • OPUS — 一大堆由網絡同電影字幕收集嘅翻譯句子。
  • Orphan sense — 一個字典嘅意思,仲未同一個共享嘅概念連結;保持可見而唔係隱藏。
  • Pagination — 將一長串結果分成編號嘅頁面,而唔係一次過傳送所有內容。
  • Part of speech — 一個字嘅文法類別:名詞、動詞、形容詞等等。
  • Pipeline — 一連串嘅程式,將資料由原始來源透過清潔步驟轉移到最終嘅家。
  • Plugin / registry — 外掛程式係一個數據集嘅小型附加程式;登記處係佢哋嘅單一權威名單。
  • Polysemy — 一個有幾個意思嘅字( bank :河岸/錢岸)。
  • PostgreSQL — 一個免費嘅開放源碼關係式資料庫(系統 Lingua Mundi 儲存咗所有嘢)。
  • Relation — 兩個概念之間嘅打字有方向嘅連結(家貓 is a 貓)。
  • Schema — 資料庫嘅藍圖:邊啲表存在,每行包含啲咩,同埋表點樣互相引用。
  • Sense — 一個字典記錄嘅一個字嘅一個意思。
  • Signifier / signified — 索索字嘅兩個面向:佢嘅聲音或者形狀(表示者)同埋佢所指向嘅概念(表示者)。
  • Sky brightness / magnitude — 呢個項目會根據有幾多語言同字詞去排名某個意思有幾「重要」。
  • SQL — 用嚟問關係式資料庫問題嘅標準語言。
  • Synset — 一組可以喺某啲情況下表達相同意思嘅字;喺 Lingua Mundi 入面,合成集嘅意思會儲存為一個概念。
  • Token — 喺機器學習入面,模型讀取或者寫入嘅一小段文字(通常係一個字或者字部分)。
  • Treebank — 一組真實嘅句子,並用佢哋嘅文法作為註解(邊個字扮演邊個角色)。
  • UD / Universal Dependencies — 一個社群項目,根據開放授權,以多種語言發佈文法註解嘅句子資料。
  • UniMorph — 一個多語言嘅字形(屈折)數據存儲庫。
  • URI — 某物嘅穩定、獨特地址,呢度用嚟表示概念(例如,家貓嘅 princeton-wordnet:02121620-n )。
  • Wikidata — 維基媒體嘅結構化知識庫,包括帶有機器可讀識別碼嘅語句,根據 CC0 發佈。
  • Wiktionary — 由維基媒體基金會主辦嘅協作字典。
  • Word form — 一種語言嘅一個字嘅拼寫;睇詞典。
  • WordNet — 原始嘅英文意思組織詞彙數據庫(普林斯頓); OMW 將其他語言同佢對齊。
  • Wordfreq — 一個跨語言嘅字頻清單資料庫,用嚟根據字嘅常見程度排名字。
  • Writing script — 一種語言用嚟寫嘅字元集(拉丁文、阿拉伯文、中文字等等)。
  • Zipf's law — 觀察到幾個字佔大部分用法,而稀有字嘅長尾佔其餘。