Lingua Mundi: Building a Language-Agnostic Map of Meaning from Open Lexical Data
One idea in every language, on one star.
A project history and technical account · 人工智慧生成的初步草稿 · RHLS 工作室 · 2026年9月7日
RHLS 商店 · Lingua Mundi · 部落格 · 英文音訊 · English · Español · Français · Deutsch · Italiano · Português · 日本語 · 한국어 · 简体中文 · 繁體中文 · 廣東話 · हिन्दी · العربية
Notice — preliminary AI-generated draft. This document was drafted by an artificial-intelligence research agent (operating inside the RHLS "DeepSeek Harness" toolchain) at the direction of Raciel Hernández Hernández, the project's author. It is not the final publication: the authoritative, human-authored paper is still in development by Mr. Hernández. Every fact, figure, and quotation in this draft traces to a dated primary source (conversation logs with ChatGPT, Claude, and DeepSeek; project journals and session logs; the software repository and its documentation; and direct measurements of the live database and application programming interface), and the sources are listed in the appendix. Statements that could not be verified are explicitly marked. No claim in this draft should be treated as peer-reviewed or as final wording.
How to read this paper. 本書專為 not 計算語言學家及 not 程式設計師而撰寫。 技術 術語首次出現時會以點狀底線標示:將游標懸停於其上(或輕觸)即可 查看通俗易懂的定義,或點擊該術語跳轉至完整詞彙表 (附錄 B)。 每項引用以及每個被提及的工具或資料來源,均附有 連結至其原始來源或官方文件。僅想了解 故事主線的讀者可閱讀第 1–3 節及第 10 節;書中中段則詳細記錄了 相關工程實作。
Author and contribution statement. Lingua Mundi 由拉西爾·埃爾南德斯·埃爾南德斯(Raciel Hernández Hernández)構思、設計 並正在開發中,他是一位駐點於墨西哥塔巴斯科州的獨立研究員 兼譯者。此專案的開發是以 人類主導的方式,與商用大型語言模型進行協作——包括 OpenAI 的 ChatGPT、Anthropic 的 Claude,以及 DeepSeek 的聊天與推理模型—— 作者將這些模型用作程式設計夥伴、審閱者及文件編寫輔助工具。 本草稿本身是由人工智慧代理在作者的指導下撰寫, 並遵循工作室的驗證規範:[H] 標示經由 帶有日期來源、測量數據或程式碼驗證的事實; [O] 標示經來源 指明的詮釋或意見;[NV] 標示無法 驗證的陳述。根據工作室慣例,公開文本採用工作室的語調撰寫,而非 作者的個人語調。
[H] Studio-voice rule (session log, 7 September 2026): "Studio/PR voice on all external/pitch copy — never Rex's personal voice." [H] Honesty rule: "No lies / no fake confidence" (studio conventions, September 2026).
Abstract
人類的詞典和詞網是以 by language 的方式組織的:一個西班牙語詞彙 檔案、一個英語詞彙檔案、一個日語詞彙檔案。 但像「家貓」這樣的語義 並非西班牙語、英語或日語所獨有——它是這三者共有的,而每種 語言僅是以不同的表層形式來指稱它:gato、cat、 chat、Katze、猫。 Lingua Mundi(「世界語言」)是一個開放、免費且 不依賴特定語言的詞彙知識庫,試圖顛覆慣常的 組織方式:它並非按語言分別建立詞典,而是先儲存 concepts (詞義)一次,並將每種語言的詞彙與這些共享的 詞義關聯起來,利用開放資料社群的多語言詞彙網作為 對齊關鍵。該專案由一人獨力開發,僅使用一台 2014 年款筆記型電腦(配備四核心 Intel Pentium 級處理器、8 GB 記憶體、 5400 rpm 硬碟,以及緩慢的網路連線——這台機器正是託管 實時系統的設備,本論文直接擷取了其運作畫面;詳見第 9.1 節),預算為零,僅使用 開放的詞彙資料。 在 2025 年 12 月至 2026 年 9 月期間,該專案 從一個存放下載字典檔案的資料夾,發展成為一個可運作的 PostgreSQL 資料庫,其中包含 96,434 concepts、1,238,383 word forms (lexemes)、 1,608,018 word senses 及 171,672 semantic relations 的 PostgreSQL 資料庫,涵蓋六種活語言 (英語、西班牙語、法語、德語、葡萄牙語及日語), 一個 能在毫秒內回覆查詢的 API 系統,以及一個以「意義地圖」為風格的 網頁介面——這是一幅可探索的星圖,其中一顆星可以同時代表 cat · gato · 猫 · chat · Katze。 本文記錄了該專案的理論 起源(即「意義」而非「拼寫」才是 多語言數據的自然單位這一直覺); 其設計所依據的數學與語言學 原則(一種語言無關的實體模型、基於同義詞集的概念對齊、 類型化關係的分類法、齊普夫排名,以及借鑒自資料庫實務的「烘焙,而非 重新推導」實體化檢視模式); 所 採用的開放資料來源及其授權條款;建構該專案所使用的工具與人機協作工作流程; 使用者介面及其教學設計;以及 過程中發現的基礎架構故障—— 包括一個無聲截斷錯誤,該錯誤曾短暫導致英文單字 cat 在自身概念中變得不可見的靜默截斷錯誤(其修復鏈於 2026 年 9 月 7 日啟動,並於 2026 年 9 月 8 日驗證完成); 該專案的當前狀態;及其未來規劃。 這篇論文同時也隱含地展現了一個案例研究:一位堅定不移的人如何 利用開放數據、免費工具及借用的運算資源來建構成果——以及那些 工程習慣(測量、標註日期、標籤、承認未經驗證之處),正是這些習慣讓 一個小型專案保持足夠的誠信,得以成長為大型專案。
本摘要中的數據與統計資料係於 2026 年 9 月 6 日至 7 日期間測量所得; 具體查詢內容、日期及來源請參閱附錄 A。
1 · The intuition: why dictionaries are the wrong shape
princeton-wordnet:02121620-n (verified subset, September 2026).每位語言學習者都曾感受到這種摩擦。當你在 英西辭典中查閱 cat 時,會找到 gato;當你在 西日辭典中查閱 gato 時,會找到 猫。 翻閱了三本辭典之後,你 花了一整個下午,只為了證實你早已懷疑的事實:同一個概念——一種 會發出咕嚕聲的小型家養食肉動物——竟然被 三個不同的組織分別收錄在三個獨立的檔案中, 使用三種不同的識別碼,卻從未與另外兩個條目建立任何關聯。
Lingua Mundi 背後的直覺在於,這種形式對於 語言學資料而言並不恰當。意義只存在一次。 而詞彙則存在多次。若有一座 資料庫,將 meanings 儲存為一等物件,並將 words 視為 不同語言賦予這些意義的標籤,便能讓人 (或程式)透過單一 共享映射,從任何一種語言轉換至任何另一種語言——並讓學習者能一眼看出,cat、gato、 chat、Katze, and 貓 並非五個需要死記硬背的事實,而是一個事實披著 五件外衣。
這份直覺並非如閃電般驟然降臨。它歷經約一年的時間, 從某個人的日常工作中逐漸萌發——而關於它的最早文獻記載 卻出奇地樸實。
1.1 The first message
在 3 December 2025 當天,作者開啟了一段與 ChatGPT 的對話,並 輸入了以下內容(逐字引用;該對話持續了四個 半月,最後編輯日期為 2026 年 4 月 21 日)[H]:
"I want to find free dictionaries similar to JMDICT and Kanjidict2 for the following languages: Spanish, English, French, Italian, Portuguese, Chinese, Korean and Vietnamese. My intent is to create a unified multilingual database for various purposes. I'm also interested in knowing if similar databases exist for indigenous Mexican languages that I can freely access."
(會話記錄,ChatGPT,對話「免費多語言辭典」, 2025年12月3日;來源檔案參見附錄A。)
那則簡短訊息中的三點,預示了該計畫日後 的發展全貌。首先,文中提及的語言——西班牙語、英語、法語、義大利語、 葡萄牙語,以及後來加入的日語——正是作者 身為翻譯家與語言教師所使用及接觸的語言(這組語言他 後來將其正式命名為「Core 6」),此外還有中文、韓文和越南文, 這些是他計畫接下來要加入的語言。 其次,「一個 unified 多語言 資料庫」這句話已明確指出目標:不是六本辭典,而是一個 將它們全部整合在一起的資料庫。 第三,作者從 第一天起就一直在思考 indigenous Mexican languages——這個主題 反覆出現(2026年8月[H]曾探討過為Lingua Mundi整合瑪雅語的方案, 而瑪雅語資源也貫穿於他的 研究筆記之中)。
這則訊息背後的脈絡也很重要。 作者並非受過正規訓練的 電腦科學家。他是一名翻譯兼語言導師,當時 也正認真學習日語,並開發了一些小工具來讓學習過程 更輕鬆:包括漢字與假名學習遊戲,以及一套日語辭典 處理流程(後來在 2026 年,一個用於日語電子書的假名註音編輯器也加入這個工具箱 ,並於2026年成為後來發展為Shikibu應用程式的專案)。他於 2025年底的主目錄中,展現了這段學習歷程的「考古紀錄」:一份於11 November 2025下載的KANJIDIC2漢字 辭典檔案副本、一份於 ,接著——受 12 月 3 日那次對話的啟發——於 5 December [H] 下載的 Open Multilingual Wordnet 資料 (檔案時間戳記,位於 /home/rex/;參見附錄 A)。 換言之,12月3日的 ChatGPT 對話 正是轉捩點:在那一刻,「我需要日文 資料來支援我的工具」這個想法,擴展成了「我想建立一個統一的多語言 資料庫,免費提供多種語言,包括我本國的 語言。」
1.2 From dictionaries to meanings: the December 2025 pipeline
作者接下來所做的,可從他建立的檔案中一窺端倪。在 2025年12月5日至12月16日期間,他以 ChatGPT 作為程式設計 夥伴,編寫了一套由 Python 個腳本組成的小型處理流程——extract_omw.py、 merge_dicts.py、unified_dictionary_pipeline.py、 crossref_deterministic.py——這組腳本負責從多個開放來源下載、解析並合併詞彙 資料,使其逐步轉化為結構更為完善的形式 [H](腳本與日期記錄於 /home/rex/ 目錄中)。 這段期間最重要的設計決策 已記錄在檔案本身中:該流程的最後 階段(日期為 12 月 16 日)會將每個條目拆分為 four kinds of objects — concept、sense、lexeme 和 grapheme(其中「字形」指書寫 符號,例如漢字)——並將其寫入磁碟,形成 JSON 行 的文件。 此架構頗具深意:一個 sense 代表 特定辭典中 特定詞彙的特定義項;一個 concept 則是跨越多種語言、 多個義項所共同指向的共享概念;而 某個詞義的 concept_id 欄位允許設定為 empty —— 意指「此詞 義尚未與共同概念建立連結。」 該程式碼中的 作者註釋將此方法描述為「零啟發式」:不進行模糊推測,不 使用統計相似性技巧來判定兩個詞彙是否同義; 僅採用明確且有文獻記載的關聯。 [H](流程程式碼與註解, /home/rex/,2025年12月;詳見附錄A。)
那份 12 月 16 日的架構圖,在微觀層面上,正是日後被稱為 Lingua Mundi 的 整個專案架構:詞彙存在於語言之中; 意義存在於共享的空間之中;而那個艱鉅且誠實的問題——哪種語言中的 哪個詞彙代表哪個概念——從未被刻意偽造。 尚未 與任何概念建立連結的詞義,會以明顯未連結的狀態保存在資料庫中, 而非被默默地猜測並填入位置。 十個月後,當導入管道中的 一個錯誤導致英文單詞 cat 無法與其概念建立關聯時, 作者正是以這樣的措辭來闡述這項原則:與其隱藏一個 孤兒,不如將其顯現出來([H];參見第 7 節)。
1.3 The gap, and the widening
隨後,相關紀錄在約五個月內陷入沉寂——從 2025年12月中旬至2026年5月下旬,現有的日誌中並未記載任何 字典處理流程相關的工作 [NV]。 對於一位需要指導學生的 在職翻譯員而言,這並非罕見,但值得明確指出:該 專案的發展是not持續的。它以間歇性爆發的方式推進,其間穿插著 數週或數月其他工作——這種節奏將持續整個 2026年。
當討論串重新展開時,其目標範圍已進一步擴大。在 1 May 2026 處, 作者正在研究「OMW v2.0 資料涵蓋範圍」(即 Open Multilingual Wordnet 版本)[H](對話標題與內容,ChatGPT,2026-05-01)。在 27 May 2026處,他開啟了一則標題為「開源語言 資源」的對話,並實質上要求提供一份系統性的清單, 列出所有可作為多語言知識庫來源的免費詞彙、 語法及語義資源 [H](ChatGPT,2026-05-27)。 至此,該專案已具備名稱與 雛形;兩者的相關佐證將於下一章中呈現。
1.4 Why this matters beyond one person's project
讀者或許會疑惑,為何一篇論文要如此詳盡地闡述某個個人專案的 直覺。答案在於,這份直覺本身就是 這篇論文的貢獻。 「meanings——而非拼寫形式——才是多語言資料的自然 單位」這一觀念,在學術界有著悠久的淵源(這是機器翻譯中「中間語」傳統最古老的 夢想,也是Princeton WordNet的詞義集的組織 原則; 參見第 2 節),但鮮少 有個人在沒有預算的情況下,將其作為公共財來付諸實踐。大多數 遵循此原則的多語言資源——開放多語言 詞網(Open Multilingual Wordnet)、BabelNet、Universal Dependencies 專案——皆由 獲得研究經費資助的大學聯盟所維護。 Lingua Mundi 是一位 獨立研究者的嘗試,他僅使用開放資料與免費工具,親自建構 這項基礎設施的一部分,用以支援他自身的翻譯與教學 工作,並將其無償提供給大眾。 這項嘗試是否成功, 讀者可根據本文其餘部分的證據自行判斷——而 作者自身的期刊文章顯示,他始終以同樣的 誠實態度,不斷提出這個問題(參見第 4.3 節)。
2 · Background: what "a map of meaning" means
要理解 Lingua Mundi 試圖建構的是什麼,以及它真正的新穎之處 在於何處,有三項先前的研究成果至關重要:其一,語言學上的觀點認為 意義可以與拼寫分離; 計算理論中,此類 意義可作為資料儲存並在不同語言間建立連結;以及現代 的觀察結果:結構化的意義地圖能與神經語言模型相輔相成——而非 與之競爭。
2.1 The sign and its two faces
現代語言學始於一個看似簡單卻深奧的觀察,通常 被歸功於費迪南德·德·索緒爾二十世紀初的演講:一個詞 是由 sound/shape(「能指」)與 concept (即 「所指」)的配對 (de Saussure, 1916/1983)。根據這種觀點,兩種語言並非 兩組恰好能相互翻譯的詞彙;而是兩組 signifiers ,它們在共同的 signifieds 空間上部分重疊。 英語的 能指 cat 與西班牙語的能指 gato 雖形制不同, 卻具有相同的所指。 倘若機器能先儲存所指,再將 能指與之配對,翻譯便會變成透過一個共享的 中介進行查詢——這個概念在機器翻譯中被稱為interlingua 方法:不是直接進行英語→西班牙語的翻譯,而是先進行 英語→含義→西班牙語的翻譯。
在機器翻譯研究中,「通用語」的夢想已有悠久歷史, 但一再被證明在完全普適性的層面上過於困難 (各語言並未將 意義切割成完全相同的片段,而且每位譯者都明白,cat 「動物」與 cat「爵士樂手」是同一個 能指所指涉的不同所指)。 但這個夢想從未消逝;它只是被收窄為某種 可建構的目標:詞彙表,即語言中能最精準對應於穩定、 共享意義的那一部分。
2.2 WordNet and the synset
這種決定性的範圍收窄源自心理學與詞典學。在 1980 年代 與 1990 年代,喬治·米勒(George Miller)及其普林斯頓大學的同事建置了 WordNet,這是一個 並非按字母順序排列,而是依據 semantically 來組織的英語詞彙資料庫 (Miller, 1995;Fellbaum, 1998)。WordNet 的核心發明是 synset (即「同義詞集」的縮寫):一組在特定語境中可代表 相同意涵的詞彙。 詞義集 {cat, true cat, Felis catus, domestic cat} is one meaning; the synset {cat, kat, guy, hombre} —— 意指「對青少年或男性的非正式稱謂」—— 則是另一種截然不同的 詞義,只是碰巧與該能指 cat 相同。 WordNet 亦記錄了 同義詞集之間的 relations —— 最重要的是 is-a 層級關係 (超義關係:家貓 is an 貓科動物、貓科動物 is an 肉食動物、 肉食動物 is an* 哺乳動物……)——將辭典轉化為一個圖,其中 語義作為節點,類型化關係作為邊。
WordNet 之所以對 Lingua Mundi 重要,有三個原因。首先,它證明了以 語義為基礎組織的、可供機器讀取的詞彙表是可行的,且極具 實用價值——現代的搜尋引擎、拼字檢查工具和自然語言 庫至今仍仰賴它。 其次,它為世界提供了一套針對詞義的穩定識別碼 系統:Princeton WordNet 為其同義詞集編號,因此 02121620-n 明確代表「家貓」,並可在各 資料庫中被引用。 第三,它成為一項多語言計畫的基石:即 Open Multilingual Wordnet (OMW)。
2.3 The Open Multilingual Wordnet: one meaning, many languages
由弗朗西斯·邦德(Francis Bond)和萊恩·福斯特(Ryan Foster)Bond & Foster, 2013發起的 OMW 計畫, 彙整了以多種語言建構的詞網,並將其與普林斯頓 英語詞網對齊:每個參與語言的同義詞集都包含指向 其對應英語同義詞集的參照。 其成果正是使 Lingua Mundi 得以實現的資源:一套由人工審核、明確表述的陳述, 形式如「西班牙語 gato(義項 1)與英語 domestic-cat 同義集 02121620-n 具有相同涵義。」 當 Lingua Mundi 的作者在其 2026年7月的工程規格書中寫道,該專案將以「同義詞集為中心」 並透過 OMW [H](規格文件, 2026年7月24日),他正是站在邦德與福斯特的肩膀上——正如他 2025年12月的處理管線腳本所展現的,該腳本直接解析了 OMW 的資料檔案, 早已如此。
2.4 The open-data ecosystem around the wordnets
OMW 是龐大且採用開放授權的生態系統中的其中一個節點,個人 可在法律與技術層面上將其整合:
- Wiktionary — 由維基媒體基金會託管的協作式辭典
Foundation — 涵蓋數百種語言的極廣泛詞彙, 包括定義、譯文、詞形變化及發音,收錄於 共享型授權條款 (Wikimedia Foundation;另見 [Meyer & Gurevych, [2012](https://doi.org/10.1093/acprof:oso/9780199654864.003.0013), 針對其作為專家詞典競爭對手的價值)。
- Wikidata — 維基媒體的結構化知識庫 — 用於儲存陳述
附有機器可讀的識別碼,並以 CC0(公共)授權發佈 網域) (Vrandečić & Krötzsch, 2014)。
- Universal Dependencies (UD) — 一個發布內容的社群計畫
涵蓋一百多種語言的、經語法標註的句子樹庫 採用開放授權的程式語言 (Nivre et al., 2020)。UD 提供貢獻 真實句子與詞性資訊——這顯示了詞語是如何 實際上被使用。
- [JMdict and KANJIDIC2](https://www.edrdg.org/jmdict/j_jmdict.html) — 日文辭典與漢字檔案
由 Jim Breen 的 EDRDG 專案維護,涵蓋日語 廣泛地,並已譯成多種語言(Breen, 2004)。 這些是作者的起點(他最早期的一份辭典檔案, 於 2025 年 11 月下載的,為 KANJIDIC2 [H])。
- UniMorph — 一個多語言的屈折形態學資料庫(詞
(例如按語法特徵分類的 run/ran/running 等形式) (Kirov et al., 2018; McCarthy et al., 2020)。
- OPUS — 一個由大量並列(已翻譯)句子所構成的資料集
來源自網路及電影字幕,採用開放授權(Tiedemann, 2012)。
- Word frequency lists 例如 [wordfreq](https://github.com/rspeer/wordfreq) (Speer, 2022),其排名
根據單字在真實語料庫中的出現頻率進行排序。
- The ISO 639-3 standard,該系統為每種人類語言分配一個穩定的
三字母代碼(例如:spa 代表西班牙語,jpn 代表日語),由維護者負責維護 作者:SIL International — Lingua Mundi 資料庫將這些代碼用作其 language 表 [H] 的鍵。
這個生態系統有兩項特徵值得特別強調,因為它們構成了 整個專案的架構。 首先,這些授權條款確實是開放的——無論是寬鬆授權或 「相同方式分享」授權——因此只要 遵守署名與授權條款,將其整合為衍生資料庫即屬合法(Lingua Mundi 會將每個匯入資料集的來源 與授權條款記錄在其專屬的 source 資料表中;詳見第 6 節)。 其次,這個生態系統是 complementary:Wiktionary 範圍廣泛但 深度淺;詞網(Wordnets)深度深但範圍窄;UD 著重於用法;UniMorph 則 著重於詞形;頻率清單則著重於顯著性。 Lingua Mundi 的工程 問題不在於「尋找資料」——而在於「合併那些原本 從未被設計為可合併的資料,同時不對關聯方式作虛假陳述」。
2.5 Why a map of meaning still matters in the age of large models
必須明確提出一項合理的質疑:如果大型語言模型已經能夠 進行翻譯、定義詞彙並對詞彙進行推理,那麼為何還要 建立結構化詞彙表呢? Lingua Mundi 該作者的解答,其論述始於 2026 年 6 月的研究 論文(第 3 節),並於當夏進一步精煉,主要包含三個部分。 首先, verifiability:結構化資料庫能夠展示其運作過程——每個連結皆附有 來源、授權資訊及日期——反觀模型的知識則是一種不透明的 統計混合體,無法進行審計、修正或引用。 其次, cost and access:查詢本地資料庫無需成本且可 離線運作,反之,每次模型查詢都會消耗能源、金錢,或兩者兼具;作者的 既定設計原則是「零代碼片段的研究查詢」——本地 API is 研究介面 [H](專案筆記,2026年8月29日)。第三, complementarity:2026年6月的論文提出一項假說——基於 三種模型的審計結果均指向相同結論——指出一個運作於概念識別碼而非原始語素之上的緊湊模型, 之所以能遠為高效,正是因為概念地圖在 網路之外 (參見第 3 節)。無論該假說能否經受 實驗檢驗,概念圖本身對模型仍具實用價值:作為一種外部 記憶體,無需重新訓練即可進行查詢、更新與引用。
因此,Lingua Mundi 的思想淵源可歸納為一句 :這是「國際語」(Interlingua)的夢想,經由 WordNet 將其範圍限縮至詞彙層面, 透過 OMW 實現多語言化,在開放資料運動的推動下獲得正當性, 並因一位譯者需要一本以「意義」而非 「語言」作為歸檔對象的辭典,而變得個人化。
3 · The name, the thesis, and the seven-graph architecture (May–June 2026)
3.1 Naming
截至 2026 年 5 月下旬,作者的筆記與規格文件採用了工作名稱 「多語言詞彙平台」[H](Markdown 規格主檔日期為 2026 年 5 月 23 日,位於 /home/rex/Descargas/Phone backup/Download/)。名稱 Lingua Mundi——拉丁語中意為「世界語言」——首次出現在 1 June 2026 的現存紀錄中,作為一份研究手稿的標題(參見 下文)[H](對話紀錄,2026年6月1日; 作者檔案中 最早經核實的出現紀錄)。此名稱恰如其分:該專案的主張並非 在於其涵蓋多種語言,而在於它是 about the one space of meaning 這些語言所共有的平台。
3.2 A research thesis: meaning, not tokens
大約在 2026 年 3 月至 6 月期間,作者透過與 ChatGPT、Claude 及 DeepSeek 的對話,發展出一篇研究論文,探討為何 語言的概念層級地圖能夠使語言技術的 效率與可及性獲得根本性的提升。 該論文在作者 帶入對話的工作框架中(原文摘自他於 2026年7月18日提交的可行性請求,其中他貼上了該描述以供審閱)[H]:
"Create a multilingual, open, machine-readable map of human language that separates: 1. Meaning · 2. Form · 3. Structure · 4. History · 5. Usage — into interoperable graphs. The long-term objective is to make language computable at the concept level rather than the token level. […] Modern NLP largely models: token → token. Lingua Mundi models: concept ↔ language."
6月手稿中闡述的核心論點是,語言 模型將其大部分處理能力耗費在surface variation上——即將「dog」、 「perro」和「犬」視為三種互不相關的事物,儘管它們實為同一事物以三種 形式呈現 [H](手稿 V4,全文引自 2026 年 6 月 1 日的審計對話 )。 倘若模型能改為讀寫 concept sequences —— 由概念圖在網路外部執行多語言處理工作 —— 該 模型便能更小、更經濟,且能在一般電腦上運行。
3.3 Seven versions in one morning: the adversarial-collaboration method
這篇題為《Lingua Mundi:基於概念的語言模型之語義基礎架構》的論文,提出了一種 seven-layer 架構: 一個概念圖(語言獨立的語義,目標規模為 10 億 節點)的目標規模)、一個詞義集圖(將各語言的詞彙映射至概念),以及 用於形態學、派生、詞源、跨語言 對應與語用學的圖——所有圖皆透過共通的識別碼系統相互連結;此外還包含一個 概念錨定模型架構(一種 Mamba 風格的序列模型,可讀取 概念識別碼的 Mamba 風格序列模型)、用於概念 圖的雙曲(龐加萊球)嵌入、事實的顯式圖檢索,以及經審計的資源預算,顯示 整個系統可運行於普通筆記型電腦上 [H](論文手稿,2026 年 6 月 1 日)。
這起事件之所以被列為method——且有異常詳盡的紀錄—— 是因為作者並非獨自完成這篇手稿。在 1 June 2026 當天上午,他利用兩個模型進行對抗式訓練,在不到半小時內 對草稿進行了連續七次修訂 (V1–V7): DeepSeek 負責起草每版修訂稿,而 ChatGPT 則以 敵對同儕審查者 [H] 的嚴謹態度審查每份草稿(對話記錄,DeepSeek 「專案Lingua Mundi的修訂與校對」及 ChatGPT「審核 回饋Lingua Mundi」,均為 2026 年 6 月 1 日)。這些審核紀錄 以逐字形式完整保留,並對每一輪修訂所修正的內容展現了異常坦率的描述:
- 已修正 INT8 嵌入式儲存空間的運算邏輯(一個因因子不符而導致的——
(儲存預算中的「二進位」錯誤);
- 一項捏造的實證性論述(「根據實證研究,我們發現……」)已被刪除,且
改為一項基於先前研究成果、並明確標示的假說;
- 將「與假設的未來模型進行比較」替換為一個
與真實版本(DeepSeek-V3)的比較;
- 該摘要中關於效能的聲明逐漸被收窄;
- 那些缺乏實證支持的擴展性主張,被重新歸類為未解決的研究問題;以及
- 該手稿經由 V7 重新構架,從一項經驗性主張轉變為一項誠實的
立場書——一份附有明確且可證偽的評估標準的研究議程 計畫(詞義消歧的穩健性、剝除實驗、基準模型)。
審核的最終結論記錄於日誌中,其中對該手稿的 vision給予高度評價,但始終對 empirical support給予低分——而 最後一次審核的結語建議則直截了當 [H]:
"If I were advising the project, I would now pivot from paper-writing to implementation. The next valuable artifact is not V8. It is Lingua Mundi Prototype 0.1 … with: 100k–1M concepts, English only, concept tokenizer, concept reconstruction, TinyStories training run, direct comparison against token-Mamba. That experiment would answer the central question: does semantic compression preserve enough information to justify the bottleneck?"
作者採納了這項建議。關於這段經歷,有三點觀察對 理解後續所有發展至關重要。首先,idea 從來都不是 瓶頸——用作者自己的話說,他所構思的藍圖在審計中獲得了 A− 的評級; 真正的瓶頸在於證據,而審計報告中也七次明確指出這一點。 其次, 作者的工作方法——將多個 AI 模型作為「對抗性 合作夥伴」、保留每份草稿與每份審核報告,並傾向於 誠實的評估而非自信的過度宣稱——已成為該工作室的永久 標準,而這正是本論文[H]/[O]/[NV]驗證 規範中可見(附錄 A)。第三,該份六月手稿的七層 架構在作者轉向 實作時並未消失:它成為了該專案的 roadmap。 現今(2026年9月)存在的Lingua Mundi 實現了概念圖、同義詞集圖、 形態學匯入、語料庫層,以及一個API; 而派生、詞源、 對應關係及用法層,則是同一 計畫中明確排入待辦階段的項目(第5–6節、第10.3節)[H](專案路線圖,2026年8月29日)。
4 · The platform takes shape (July–August 2026)
4.1 Feasibility: "can this be done with open-source components?"
在 18 July 2026 處,作者直截了當地詢問 ChatGPT,這個構想 是否能利用現有的免費元件來建構,以及他需要什麼 來開發它 [H](對話「Lingua Mundi 專案可行性」, 2026-07-18, 00:44 UTC — 相當於作者所處的中部時區 7月17日傍晚)。這段對話——以及隨後數週的互動——記錄了 該專案從研究論文轉向工程計畫的轉折。 該專案採用了 他貼入該對話中供審閱的正式使命聲明(引述 於第 3.2 節),而作者也開始 架構實際程式碼:磁碟上存有日期為 2026年7月17日 [H](程式碼快照,2026年7月;參見附錄 A)。
4.2 The engineering specification (24 July 2026)
在 24 July 2026 時,作者將該設計彙整成一份 104 頁的 工程規格書,即《多語言詞彙平台——工程 規格書》(Multilingual Lexical Platform — Engineering Specification),版本 2.0,副標題為「修訂版暨可投入生產版」 [H](PDF,/home/rex/,2026年7月24日;本文所引用之內容即摘自該文件)。該 規格書即為本專案的憲法,其內容闡述了日後所建構內容的 絕大部分:
- The synset-centric principle. 該文件指出,每個詞法
物件最終必須與 synset(一種意義)相關聯,而且該 資料庫是根據詞義而非拼寫來組織的。這套方法行得通 例如,字詞 bank 必須是一種具有多個 不同的同義詞集(「河岸」、「金融機構」、「寄望於」 某物」)——絕非一團未經區分的意義 [H]。
- Language tiers. 該規範將語言分為兩個層級:
首發支援的語言 — 英語、西班牙語、法語、葡萄牙語、日語,以及 普通話(簡體與繁體)——以及第二級——義大利語, 韓文和越南文 [H]。(實際隨產品出貨的 該資料庫有兩項值得注意的差異,詳見第 10 節:該 Live Six 包含英語、西班牙語、法語、德語、葡萄牙語、日語—— 沒有普通話和義大利語,有德語。替換後為 在現存的紀錄中並未處處說明 [NV],這是一項坦率的承認, (一個尚未釐清的來源問題。)
- The data model. 該規格的第 5 章概述了該模式
概括而言,該儲存庫首個遷移中隨附的模型是 一個由十一張桌子組成的核心區域,與 2025年12月原型中的「四實體直覺」,現已正式化: 語言、語素、詞義、概念(同義詞集)、關係、來源、 語義集合,以及相關表格(參見第 5 節)。
- A five-level alignment hierarchy. 因為自動連結和手動連結
由於詞彙與概念之間的對應在可靠性上有所差異,因此所提出的規範 五個對齊信心等級,源自來源明確標示的連結 (例如,OMW 映射)直至啟發式推測——其規則為每個 儲存的連結會附帶其置信水準。這是該 2025年12月「零啟發式」規則:並非 no 自動建立連結,而是 labeled, honest 連結至 [H]。
- A phase roadmap with gates. 第 0 至 5 階段,每個階段皆設有退出標準,
從資料模型和 ETL 到 API 再到應用程式。
- A risk register — 包含一份附有詞源分析的自我批判附件
以及 CJKV/Unihan 層,並針對日語與中文的「假朋友」提出警示 (例如,日語中的「娘」意為「女兒」,而中文中則意為「母親」;「手紙」意為「信」,而 「衛生紙」)[H]。
該規格書還定義了該專案日後將簡化的堆疊: FastAPI、PostgreSQL、一個搜尋引擎(規格書中的 Meilisearch),以及一個 網頁前端(Next.js)。 值得注意的是,到了 8 月 13 日,作者自己已經 開始質疑該技術架構了(第 4.4 節)。
4.3 The July journal: thinking about the semantic operating system
大約在同一時期,作者的私人日記 (knowledge project.txt, 85 KB,本文已全文閱讀;檔案時間戳記 2026年7月18日,單次工作時段)記錄了一段相關且更具個人色彩的 思考脈絡:他試圖闡述一個 「通用語義圖」(universal semantic graph)——一種獨立於符號系統、能跨程式語言、音樂理論、化學及 自然語言來呈現意義的方法(他將此獨立專案稱為 USG)[H](日記, 2026年7月)。 該期刊中最與《Lingua Mundi》相關的段落(第 2563– 2587行)是他對「同時以三種語言呈現one semantic object」 所意味著什麼的反思——這與cat · gato · 猫的直覺相同, 但此處是作為思考介面而非語言的練習而寫下 [H]。值得注意的是,該期刊自身用來闡釋的「語言」實例 ,正是 Lingua Mundi 程式碼庫的 LanguageCreate 模式——這證明了 到了七月中旬,這兩條脈絡(研究願景與實際程式碼) 在他腦海中已經交織在一起 [H]。
4.4 August: from schema to running system
2026年8月,Lingua Mundi 變成了 system。現存的日誌顯示了一系列 密集的決策,每一項都留下了痕跡:
- 1–8 August. 作者探討了圖論與知識表示
選項(「JSON 作為圖表」,7月29日;API 變現構想,8月7日至12日) 並——這對最終的架構至關重要——詢問了 API 是否 「確實需要」一個大型堆疊(第 4.5 節)[H]。
- 11 August. 他探討了將 Maya languages 整合至 Lingua 的可能性
Mundi(「Lingua Mundi 馬雅語整合」),延續對 墨西哥原住民語言首次在 2025 年 12 月的訊息中被提及 [H]。
- 13 August. 經過兩次設計討論,最終確定了該物件的形狀,
產品:「語言 API 技術堆疊」(參見 4.5)與「語義互動」 「Layer」,該概念勾勒出知識層之間未來的介面 以及應用程式 [H]。
- 19–25 August. 他打造了 Japanese demonstration:一款小巧的
離線資料庫 (SQLite) 整合了日文辭典資料,以便讓 以概念為導向的設計可以被觸摸、查詢,並展示給他人看 (「編譯日文示範版」;生成的 lingua-mundi-jpn.sqlite 個檔案是 (儲存於磁碟中)[H]。該衝刺設有具體的截止日期,且 與會者:Japan Foundation的代表原定於該處 下週在大學,以及該演示(連同假名標註 (同期正被重新命名為 Shikibu 的編輯器)是以以下方式準備的: 該次拜訪的留存產品檔案 [H](對話記錄、 (2026年8月19日至25日)。
- 23 August. 當被要求用一段話描述這個概念時,他
收到一份摘要,內容與日誌所顯示他所建構的內容相符:「a 人類語言的機器可讀語言基礎架構……倒不如說 Lingua Mundi 不僅僅是一本日文辭典或翻譯應用程式,而是 「旨在成為一個通用的語言智能層」[H] — 此外,在同一次對話中,有一段 technical 描述,其中提及了 當時規劃的堆疊 (PostgreSQL, 圖查詢時為 Apache AGE,OpenSearch 為了檢索,FastAPI 作為 API,即下個月的測量值 將使之變得沒有必要(第 4.5 節、第 6 節)[H]。
- 24 August onward. 程式碼庫已遷移至其永久位置,成為一個
適當的儲存庫(「LinguaMundi」),其中包含每日 GitHub 備份快照 追蹤記錄始於 8 月 27 日 [H](儲存庫快照;參見附錄 A)。
4.5 The lean-stack decision that shaped everything
八月間最具影響力的技術決策已原封不動地保留下來。在 13 August 2026 處,作者貼出了他自己規劃的技術堆疊—— FastAPI、Polars、DuckDB、PostgreSQL、Apache AGE(一種圖擴展)、 OpenSearch、Redis、Celery、React 以及 Docker——並提問:「如果 語言學 API 已經能在 Postgres 上運行,是否真的需要這個技術堆疊?」 [H](對話「語言學 API 技術堆疊」,2026年8月13日)。
他得到的答案——也是他採納的答案——是這些功能目前幾乎都不需要 :僅靠 PostgreSQL 便足以處理關聯式辭典資料、漢字、 讀音、詞形變化、翻譯、全文檢索,甚至圖式 遞迴查詢;而正確的準則應是「PostgreSQL 限制 → 增設 技術」,而非「第三階段要求圖形資料庫 → 安裝圖形資料庫」 [H](同一段對話)。 這項建議總結道:「貴公司的 API 競爭 優勢不在於基礎架構,而在於您在資料之上所建構的 語言資料模型與轉換機制」 [H]。
這項決策——一個關係資料庫、一個 API 框架, 在有實際需求之前不採用其他任何技術——正是第 6 至 7 節中 所述效能架構的直接前身。 當 2026 年 9 月, 資料庫擴增至 160 萬個詞義,而簡單查詢的速度卻降至 需耗時數分鐘時,作者並未轉向圖資料庫或搜尋引擎: 而是採用了 PostgreSQL materialized views —— 即「預先處理,勿 重新推導」模式 —— 並在 2014 年的硬體上,將最慢的查詢時間從超過一分鐘縮短至 約一秒(第 7 節)。 八月時所做的 「保持精簡」決策,正是讓九月那次優化既必要又 成為可能的關鍵。
4.6 The human-AI development method, in practice
閱讀這部歷史的讀者應該會注意到,幾乎每個重要里程碑都 附有一份對話紀錄:作者是以對話的形式進行思考的。到了 2026年8月,他的方法已趨於穩定,並發展成一種可從紀錄中 精確描述的模式:
- The human sets the direction and owns the data. 該中的每個請求
日誌屬於作者本人;每個檔案都存放在他的電腦上;每項決定—— 包括像「lean-stack」問題這樣的反轉——這都是他的功勞。
- AI models are used as specialized collaborators. 使用 ChatGPT
廣泛應用於研究、建築評論及審計;DeepSeek 則用於 草擬與修訂週期,以及(後來)作為支撐該系統的底層框架 工作室自有的自動化系統;Claude 用於長期記憶與專案管理 背景(該工作室的知識庫最初源自 Claude 的記憶匯出檔案)。
- The record is kept. 對話已匯出(作者的檔案庫)
(包含數千個),程式碼會被快照存檔,而且——從 2026 年 8 月 26 日起——每個 工作會議的紀錄已存入 Obsidian 知識庫中,其中包含 前言、日期及審核狀態(第 9 節)。本文是 這一切之所以能實現,全賴於那項記錄保存的習慣。
- Adversarial review is built in. 六月稿件的 V1–V7 審核
循環審查(第 3.3 節)已成為常規做法:草稿會由一位 與撰寫這些文件的模型不同,且審計記錄保存在 檔案。
無論將此稱為「氛圍編碼」、「AI 輔助開發」,抑或單純 「使用工具」,為求記錄之明確,如實標示至關重要:Lingua Mundi 是一個由人類主導、透過有意識且有據可查的合作方式 與 AI 助手共同建構的專案,而本文(根據前言說明,其本身是 在作者指導下由 AI 產生的草稿)正是採用相同 方法產出的成果。
5 · Design: the linguistic and mathematical principles of the model
本節以淺顯易懂的語言,說明決定 Lingua Mundi 如何儲存語言的相關概念。若讀者想了解 history,可直接跳至第 6 節; 若讀者想了解 formulas and schema,則可在此處及 附錄 A 中找到相關內容。
5.1 Four kinds of objects, one space of meanings
此資料模型直接源自 2025 年 12 月資料流程中的四個 實體類型(第 1.2 節),以及 2026 年 7 月規格中的十一張 資料表 [H]。 在其成熟階段,它儲存五種核心類型的項目 (已根據 2026 年 9 月的實時架構進行驗證 [H]):
- Language — 每種人類語言佔一行,以該語言的 ISO 639-3 代碼為鍵
三字母代碼 (eng, spa, jpn, …),連同其名稱、自稱(即 (使用者常用的名稱)、語系及書寫文字。新增一個 根據設計,將語言套用至整個系統的方式,是新增一行加上資料集: 任何地方都沒有按語言分類的表格 [H](程式碼與專案註記, (2026年8月29日)。這種「語言中立」的特性屬於模式層級的 「通用語」概念的闡述(第 2.1 節)。
- Lexeme — 特定語言中的一個詞形:字串
cat,該
字串 gato、字串 猫。一個詞素僅屬於一種語言 並具有詞性。
- Sense — one meaning of one lexeme as recorded by one dictionary:
「cat」作為動物的名詞,源自 WordNet;「cat」作為爵士樂手的稱謂,則源自 WordNet,源自Wiktionary中「聖誕木柴」的「cat」一詞。一個詞素通常具有 多種含義——這就是該模型如何表示 polysemy(一個詞, (多種涵義)卻從未將這些涵義混為一談。某種語義可能或 可能尚未與任何概念建立關聯;該關聯即為欄位 concept_id, 而且它是 nullable by design —— 一個未連結的釋義被保留下來,並顯示為 一個孤立的項目,而非被推測填入的位置 [H](模式;管線註解, (2025年12月)。
- Concept —— 一種跨越語言的共通意義:該概念
由 Princeton WordNet 同義詞集 URI 識別的「家貓」 princeton-wordnet:02121620-n [H](即時資料庫)。概念是…… 多語言對齊如下:西班牙語 gato(其其中一個詞義), 英語 cat、法語 chat、德語 Katze 以及日語 猫 皆可 指向同一個概念——它們是「一顆星」,只是名稱各異 (第 8 節)。概念表是系統的核心,而在 當前資料庫共包含 96,434 筆資料 [H](測量資料,9 月 6 日至 7 日) 2026年)。
- Relation — 兩個概念之間的一種具類型且有向的連結,
例如:家貓 IS_A 貓科動物,或貓科動物 IS_A 食肉動物。關係 包含一個謂詞、一個置信度以及一個來源。目前資料庫中儲存了 其中有 171,672 個 [H](測量日期:2026 年 9 月 6 日至 7 日)。
這五項核心元素周圍,配置了來源追蹤機制——一張source表格,用於記錄 每個資料集的來源、授權條款及其網址(以確保資料庫中的 所有陳述皆有明確來源),以及用以銜接至 OMW 格式的詞彙集表格,還有用於漢字與讀音的輔助表格 [H] (資料結構, 2026年9月)。
5.2 The alignment problem, and why it is not faked
多語言意義地圖的核心理論問題在於 alignment:判定this語言中this一詞的this個義項 等同於that語言中that一詞的that個義項。 Lingua Mundi 的解答——源自 OMW 的設計——是透過 not 來決定此對應關係 :OMW 已針對每種語言明確指出,其哪些同義詞集對應 於 Princeton WordNet 同義詞集,因此資料庫將這些明確的 對應關係匯入作為其主要對齊層 [H] (Bond & Foster, 2013;匯入 程式碼)。 若不存在明確對應關係,系統將套用其 五級 可信度層級(源自 2026 年 7 月的規格說明):來源 明確標示的連結排名最高;推論出的連結排名最低,並儲存於 with their level — 絕不會在未經通知的情況下被提升為「事實」[H] (規範,2026年7月24日)。這是作者於其處理流程程式碼中草擬的 12月規則的成熟形式:「零啟發式」。 這並非表示 系統從不進行推測;而是推測會被標記為推測,這 正是使資料庫成為 honest enough to grow 的關鍵:一個被 標記為推測的錯誤推測可以被找出並修正;而一個被當作事實儲存的錯誤推測 則會毒害後續的所有內容。
相同的哲學原則同樣適用於語言的細分層級。ISO 639-3 區分的是真正的語言,而非政治邊界或書寫系統 的變體。作者已針對未來標示出一個真正棘手的案例: 韓語,其單一 ISO 代碼 kor 同時涵蓋大韓民國 與朝鮮民主主義人民共和國的標準。現存 紀錄顯示此問題已被標記為待決的建模決策 [H] (會議紀錄,2026年9月7日)——這既是該架構「儲存languages而非地區設定」原則的例證, 也提醒我們,現實世界的語言 資料難以被簡潔地歸類為「每種語言一列」的框架之中。
5.3 The graph: taxonomies, neighborhoods, and the long tail
一旦感官與概念對應,且關係將概念相互連結,該 資料庫 is 便形成一個圖:96,434 個意義節點由 171,672 條帶類型邊相連, 其中最大的組成部分是從 WordNet 繼承而來的 is-a 分類法 (哺乳動物 → 肉食動物 → 貓科動物 → 家貓),並透過「是……的實例」、 「是……的一部分」以及跨語言關係 [H](測量,2026年9月; 模式)加以豐富。關於此類圖的三大數學事實,形塑了使用者 介面與工程設計:
- Taxonomies are trees of meaning. 因為每個概念的父類都是
如前所述,該系統能夠回答「這是什麼類型的?」(向上攀爬)以及 「這有哪些種類?」(往下爬)—— 背後運作的原理是 介面的分類學透鏡(第 8 節)。
- Degree distributions are Zipfian. 真實語言圖是
scale-free-ish:某些概念(例如「動物」、「人」、「事物」)具有 龐大的鄰域,而大多數概念僅有寥寥數個鄰居。 這種「長尾」現象,正是統計學上那種著名的形狀 Zipf,曾於 詞彙出現頻率 (Zipf, 1949):少數詞彙佔了絕大部分 用法。由此衍生出兩項設計上的後果:必須存在排序機制(你無法 (顯示單一查詢的 30,000 個詞義),且排名必須是 meaningful — 因此,該介面會根據概念的 sky brightness 對其進行排序,一個 用以衡量某個涵義的「重要性」或其連結程度(第 5.5 節)。
- Shortest paths are the natural translation route. 假設有兩個概念,
可以在圖中搜尋連通路徑——此操作背後的原理是 介面中的六分儀工具(第 8.4 節),其實現方式為一個有界 在分類法上進行雙向廣度優先搜尋(≤ 10 跳, 每個節點有 25 個鄰居,回應時間以毫秒為單位) [H] (程式碼,即時 測量,2026年9月)。
5.4 Zipf and the shape of dictionaries
Zipf定律值得特別提及,因為它悄然闡明了 整個效能架構。如果詞彙頻率遵循冪律,那麼 任何辭典都將由一小部分常見詞彙(短頭)和 極其龐大的罕見詞彙(長尾)所主導。 2026年6月的論文手稿甚至推導出 基於Zipf的概念詞彙表[H]的覆蓋率計算方法 (手稿 V7 審計版,2026年6月1日)。 對於資料庫而言,長尾現象意味著: 大多數 rows 屬於罕見詞彙,大多數 queries 命中常見詞彙,而任何 必須掃描整個資料表(包含所有罕見詞彙)的查詢, 其執行速度都將遠遠慢於能從預先計算出的 排序開始的查詢。 第 7 節所提的實體化視圖模式,歸根結柢是一種 將 Zipf 定律從效能的敵人轉變為設計工具的方法:將 head(即排名,每個概念的前幾項詞彙)預先計算一次,並讓 tail 保留在關聯資料表中,以供實際需要進行罕見查詢時使用。
5.5 Sky brightness: one ranking to rule the map
該介面的組織隱喻是 star map(第 8 節),而 此隱喻背後有實際的運算作為支撐。 每個概念都被賦予一個 brightness —— 一個用於對天空進行排序的數值量度 —— 其來源於該概念 在多語種圖譜中的地位:有多少種語言附有相關詞彙、 這些詞彙集的豐富程度,以及該概念在 分類法中的重要性。 資料庫將此具體化為 concept_sky_rank,即 對所有 96,000 多個概念預先計算出的排序,因此「給我天空」 在請求時從不需要對一百萬行資料進行排序 [H](腳本與 測量,2026年9月6日)。兩個配套檢視 — concept_lang_rank (各語言排名)與 concept_word_rank(每種語言中每個 概念的前四個詞彙,經「預處理」後,使為星標補充其詞彙僅需 進行查閱,而非對 160 萬個詞義進行聯結)——共同完善了此排名系統 [H](腳本,2026年9月6日;行數統計見附錄A)。
5.6 Bounded work: the game-designer's discipline applied to a database
最後一項設計原則借鑒自電子遊戲。無論遊戲世界規模多大,遊戲總是在 16 毫秒內渲染一幀畫面:它會為每幀畫面分配工作量。Lingua Mundi 採用了相同的原則——在無界數據空間上,每 次查詢的工作量皆受限——因為其硬體有此需求 (一台 2014 年的筆記型電腦;第 9 節)。任何請求都不得掃描整個語料庫;每個 請求都必須從索引或預先生成視圖開始;介面僅在 使用者執行操作時才進行渲染(CPU 閒置率 ≈ 0%);且結果會以 穩定的視窗進行分頁。 第 6 節和第 7 節闡述了這項 規範所遭遇的三項效能瓶頸,以及如何透過相同的模式解決每項瓶頸:預先生成,切勿 重新推導。
6 · Architecture: importing the world, serving the map
6.1 The pipeline: one registry, twenty-plus importers
每個資料集都是透過 importer 進入 Lingua Mundi —— 這是個 懂得讀取某種外部格式,並將其寫入標準模式的程式。 唯一的權威進口器清單存於一個檔案中,即進口器 登錄表;截至 2026 年 9 月,其中已包含超過二十個註冊外掛程式, 涵蓋: Princeton WordNet 以及英語 WordNet、Open Multilingual Wordnet (OMW)、Wiktionary 及其可機讀的衍生格式 kaikki、Wikidata、 UniMorph 及 J-UniMorph(形態學)、Universal Dependencies 樹狀語料庫(UD)、 OpenThesaurus(德語同義詞)、CMU 發音 辭典, IDS character decompositions、CLICS 跨語言資料、 詞頻清單,以及日語語族 — JMdict、EJDict、KANJIDIC2 [H](匯入工具登錄表與專案備註,存取日期 2026年9月6日至7日)。 (關於精確度的注意事項:匯入者目錄中確實存在一個用於 OPUS 平行 語料庫的資料夾,但該資料夾為空且未註冊的 佔位檔,正等待路線圖中的句子層級功能——此處列出是出於誠實原則, 而非作為已發布的來源 [H] (程式碼清單,2026年9月6–7日)。) 每個匯入器皆依據 相同的ISO代碼註冊其目標語言,這正是使該架構在 實踐中(而不僅是理論上)保持語言中立性的關鍵 [H](程式碼)。
匯入作業由一條管線負責監督,該管線會執行每個來源、記錄 匯入任務,並——這對第 7 節至關重要——回報成功與否。 每次 匯入完成後,它會更新排名檢視(第 5.5 節),以確保「天空」始終 反映最新資料 [H](腳本,2026 年 9 月)。
6.2 The corpus today (measured)
於 2026 年 9 月 6 日 23:02 中西部時間對線上資料庫進行的直接 SQL 測量,並於 2026 年 9 月 7 日重新驗證(兩次計數結果相同)[H]:
| Table | Rows |
|---|---|
| concepts (meanings) | 96,434 |
| lexemes (word forms) | 1,238,383 |
| senses (word-dictionary meanings) | 1,608,018 |
| relations (typed concept links) | 171,672 |
| languages (live) | 6 — eng, spa, fra, deu, por, jpn |
各語言的詞彙權重(詞彙豐富度審核,2026年9月6日 [H]):
| Language | Lexemes | Senses |
|---|---|---|
| Japanese (jpn) | ≈ 345,000 | ≈ 528,000 |
| English (eng) | ≈ 271,000 | ≈ 393,000 |
| German (deu) | ≈ 176,000 | ≈ 203,000 |
| Spanish (spa) | ≈ 152,000 | ≈ 167,000 |
| French (fra) | ≈ 149,000 | ≈ 157,000 |
| Portuguese (por) | ≈ 145,000 | ≈ 160,000 |
針對這些數字,有兩點必須誠實地提出提醒。首先,各語言的數據 僅為近似值(根據審計結果四捨五入);而表格層級的 SQL 計數則 在測量當下是精確的。其次,該語料庫是 layered: 部分 資料集(所有 Wiktionary 及詞頻清單)在每次匯入執行時,皆刻意 設定為 50,000 行上限,其餘更深入的涵蓋範圍則由其他 來源提供,且該上限已明確記載而非隱藏 [H](稽核報告,2026 年 6 )。第 7 節說明當類似的上限被not 記錄為風險時會發生什麼情況。
6.3 The API surface
該系統公開了一個小型且刻意凍結的 HTTP API(FastAPI)介面,其 Phase-0 介面據文件記載,即使有新階段推出,也絕不會因此中斷 [H](專案備註,2026年8月29日)。 以下端點已於 2026年9月 [H] 進行實機驗證:
/languages— 列出現存語言及其元資料;/lexemes和/concepts— 分頁清單查詢(限制/偏移量、上限
(因八月至九月間的審計發現這些文件未裝訂,故每頁收費 1,000);
/analyze— 某個詞的形態學/詞法分析;/kanji和/lookup—— 日本漢字與字典查詢;/graph/sky— 星空圖資訊源:依天體亮度排序的概念,其中
搜尋參數 (query, lang),深度 (skip/層級),是否要 附加成員詞 (words),以及一個 taxonomy lens (anchor, lens=up|down) 從給定的位置沿著 is-a 樹向上或向下移動 概念;
/graph/star/{id}— 一顆星的完整內容:每種語言中的成員詞彙及其
其相鄰的概念,兩者皆為分頁式;
/graph/path— 兩個點之間的有界圖搜尋(第 5.3 節)
概念;
/graph/word——「詞彙透鏡」:給定一個詞彙和一種語言,其概念
其感官目前所連結的對象。
所有回應皆經過壓縮(gzip),且每個查詢皆設計為從 索引或實體化檢視執行——此即第 5.6 節 [H](程式碼與即時標頭,2026 年 9 月)所述的「有限工作」規則。
6.4 Why the design is language-agnostic in the database, not just on paper
讀者現在可以看清整個循環。一種新語言的引入,是由一行 language (例如,普通話,代碼 cmn)加上已註冊的資料集(OMW 普通話 詞網、UD 普通話樹狀語料庫)所構成。 匯入工具會寫入該語言的詞素、詞義,以及—— 若存在 OMW 或其他明確對應關係時——其詞義→概念的關聯。 排名檢視會重新計算;系統中新增了一種語言;沒有表格變更; 沒有資料遷移;API 中也沒有特殊情況。接下來規劃沿著這條 精確路徑擴展的語言家族——普通話、粵語、韓語和越南語——詳見 第 10.3 節中,其中決定 其時程表的資料可用性勘查紀錄載於 [H](會議紀錄,2026 年 9 月 7 日)。該 設計的承諾——「無限添加語言」——因此並非行銷噱頭:這 是資料結構的直接結果。
7 · Two infrastructure lessons: bake-don't-re-derive, and fail-loud
每個資料庫專案終究都會遇到效能瓶頸。Lingua Mundi 我們在一週內就遇到了其中三項——隨後卻發現,最耐人尋味 的問題並非速度,而是寂靜。本節將同時講述這兩則故事,因為 它們共同構成了該專案中最具普適性的工程教訓。
7.1 The pattern: bake, don't re-derive
這條解決了全部三項效能瓶頸的規則,簡單到只需一句話就能說明: 當許多查詢都需要進行相同的耗時運算時,只需 運算一次,儲存結果,並保持其最新狀態——不要針對每個 查詢都重新運算。 以資料庫術語來說,Lingua Mundi 採用了 PostgreSQL 的 實體化 檢視:這些預先計算好的資料表,就像是充滿答案的索引。
- Wall 1 — ranking the sky. 原本是詢問預設的星圖
迫使資料庫對整個語料庫進行重新排序 per request:大約 在該專案的 2014 年款筆記型電腦上,每次耗時 8.6 秒。此修正方案已將 依 concept_sky_rank 和 concept_lang_rank 排序(94,498 和 218,120 行預計算結果),隨後「預設天空」在 約 0.25 秒,而更深層的請求則在數十毫秒內完成 [H](經測量, (2026年9月6日)。
- Wall 2 — naming the stars. 志存高遠 with its words
附件(各語言中各概念的頂部詞彙)需在 1.6 中進行關聯 每次請求都會觸發數百萬個感測器;當星級為 1,000 時,該查詢耗時 超過 一分鐘 —— 一個病理案例。這項修正將字詞本身固定下來: concept_word_rank 針對每個概念,預先計算前四個詞彙,每 語言(建立時有 338,378 行),將一項耗時一分鐘以上的聯結轉變為 搜尋時間約 1.1 秒,預設檢視時間約 0.25 秒 [H](經測量, (2026年9月6日)。
- Wall 3 — hierarchy and pagination. 攀登與下行
分類法(鏡頭上移/下移)以及在穩定的星場視窗間翻頁的過程是 透過標準謂詞、索引排序及穩定的分頁來解決 Windows(DISTINCT ON 風格的查詢)而非圖形資料庫 — 八月「精簡堆疊」決策(第 4.5 節)所帶來的效益 [H] (代碼與測量數據,2026年9月6日)。
每次匯入後,檢視畫面都會自動重新整理,因此「預先計算」絕不代表 「過時」[H](腳本)。 整個模式是資料庫原生實現的 所謂「預算化」概念:耗時的工作僅執行一次, 且不在關鍵路徑上,而使用者的請求永遠只讀取預先計算好的 結果。
7.2 The silent truncation that hid cat
2026年8月下旬,語料庫的英語層被匯入時,設定了一項 行數上限,但這根本不是任何人原本打算設定的上限。負責監督匯入的 腳本將英語 Open Multilingual Wordnet 的匯入數量限制為 50,000 候選詞 — and then reported success [H](會話日誌,2026年9月6日 ,根本原因記錄)。在該檔案的字母順序中,英語 cat 是候選詞 number 52,195, 因此被截斷。 在 117,659 個英語同義詞集之中,約有 21,830 個 從未被建立;對於這些語義,英語 詞義雖以原始辭典條目形式存在,卻從未與概念建立關聯。 該詞 cat 並非從資料庫中遺失——而是對 映射而言不可見:搜尋其義項時無法找到它,因為其義項本應指向的 義項節點從未被建立 [H](同 來源)。
大約六天的時間裡,沒有人知道箇中緣由。作者所關注的示範程式——cat · gato · 猫 在單顆星的設定下——在西班牙語和日語中都能正常運作,但在英語中卻顯示為空, 而這個空結果看起來像是一個資料缺口——彷彿英語中根本沒有這個詞。 (根據紀錄中的時間註記:多語言「天空」功能本身直到 直到 integrate_core6.py 在 8 月至 9 月的匯入作業接近尾聲時,完成匯入語言的連結——在此之前,備用天球僅為 一個單一語言的小型視圖——這正是為何英語的空缺直到 9 月初才浮現,即共享概念視圖實際上線之後 [H] (會話日誌,2026年9月6日)。)作者本人在 會話日誌中堅持認為, 這正是 "not a data gap — infrastructure" [H](會話日誌, 2026年9月6日)。他是對的。 問題不在於資料本身,而在於 處理流程的「誠實度」:一次不完整的匯入作業被報告為成功,而系統中 没有任何設計能察覺到,當匯入上限設為 50,000 行時, 所謂的「成功」實際上意味著第 52,195 筆候選資料的失敗。
7.3 The fix: an uncapped, idempotent repair chain
此次修復作業——於 2026 年 9 月 6 日至 7 日設計並啟動,並於 2026 年 9 月 8 日確認完成(參見第 10.1 節)——是修復資料 傳輸管道時,如何在不丟失資料或損害信任的情況下進行的典範 [H](腳本與會話記錄, 2026年9月6日至7日):
- Re-import the English WordNet without the cap — 具有幺冪性,因此一個
中斷的執行流程可直接重新啟動,且不會重複產生資料列;
- re-run the synset-to-synset relations 適用於新建立的同義詞集;
- integrate:將新的語義集提升為概念,並連結其成員的語義
concept_id 個欄位,並重新表述概念間的關聯;
- refresh the materialized views 因此,這張地圖反映了修繕後的狀況
語料庫;以及
- verify end-to-end 並附帶一個驗收腳本,該腳本能根據
透過資料庫及即時 API,該英文 cat 傳達到 家貓的概念 princeton-wordnet:02121620-n 及其 多語種成員 — gato, chat, Katze, 猫 — 且該 該概念具有分類學上的父類別。接受性檢查的設計目的是 可隨時重新執行,並以響亮的「PASS」或「FAIL」聲響結束。
由於每個步驟都設計為冪等(get-or-create、 skip-if-exists),因此修復過程中發生機器當機,除了耗費時間之外不會造成任何損失: 該鏈可重新啟動並完成任務。此特性同時也能保護 線上資料庫免於陷入部分完成狀態。
7.4 The lesson: fail-loud vs. fail-silent
這起 cat 事件,正是每個資料工程師都深感畏懼的問題之教科書級案例: a pipeline that fails silently and reports success. 從方法論上 汲取的教訓——即「行數上限」並非成功標準,且匯入者必須 驗證資料的完整性,而不僅是完成度——值得作為開放資料基礎設施的一項 普遍原則來闡明,因為在該環境中,資料集的來源沒有 任何保證,且資料處理流程需手動組建。 Lingua Mundi 的回應 以兩種形式制度化:任何未來 匯入鏈皆可執行的驗收腳本,以及工作室的常規規定:未經驗證的 聲明須標記為「未經驗證」——無論是在資料庫中(孤立的語義仍保持 可見,連結上的信賴等級)還是在每份書面紀錄中 (本論文中 [H]/[O]/[NV] 的慣例,附錄 A)。 一個能夠顯示 其孤立項的系統,是其缺口可以被發現的系統。一個隱藏這些缺口的系統 ,是其缺口終將被發現的系統——最終,會被最糟糕的 人發現:一個正在尋找 cat 的使用者。
8 · The interface: a star map of meaning
單純的資料本身並非產品。塑造 Lingua Mundi 介面的問題很簡單:what should looking at a map of meaning feel like? 作者在 2026 年 9 月第一週所構思出的答案是: 它應該讓人感覺彷彿在仰望天空——更具體地說,就像是一張 虛構的寶藏星球星圖:一張可供探索的紙質宇宙地圖 ,其中每顆星辰代表一個想法,而語言則是你選擇用以 觀測它的望遠鏡 [H](會議記錄,2026年9月1日至7日)。 本節 將描述最終形成的介面:其教學隱喻、視覺 語言、工具,以及讓所有 功能能在 2014 年的筆記型電腦上運行的工程技術。
8.1 From dictionary page to sky: naming the product
該介面在兩週內歷經三次改版,其名稱 反映了產品的演變歷程 [H](會話記錄,2026年8月31日 – 9月6日 )。它最初僅是一個普通的字典頁面(「/gui/」,於 「觀測站」),於9月1日隨著 資料匯入完成且星場視覺化效果出現,轉變為Planetarium;隨後 作者檢視結果並宣稱這些星星是「架設結構,而非 產品」 ——於 9 月 6 日夜間轉型為 語義圖 探索器:同樣的星空,但如今 the point 代表了意義,其中的節點 是您啟用之語言所標註的概念,邊緣依 關係類別分色,搜尋功能則能消除詞義歧義。 舊有的星空視圖 雖被保留但已斷開連結;該探索器成為 Lingua Mundi [H] 的預設介面(會話日誌,2026年9月6日)。
8.2 The pedagogical metaphor: an instrument, not a dashboard
介面的每個元素都與 天文學及該語言專案本身中的某個概念形成一對一對應——這是一種刻意為之的教學 設計(隱喻表即是該產品的內部文件) [H](會話記錄,2026年9月6日至7日):
| Star-map element | What it really is |
|---|---|
| A star | A concept — one meaning, shared across languages |
| The stars' brightness (magnitude) | A concept's lexical richness and connectedness (Section 5.5) |
| The language you look through | A telescope — the same sky seen in Spanish, English, Japanese… |
| Constellations and threads | Families of relations — the is-a taxonomy drawn as plotted course lines |
| Zooming in | Descending from the wide sky to a single star and its neighborhood (the Hipparcos→Gaia idea — Gaia Collaboration et al. (2018): more detail the deeper you go) |
| The exposure dial | Deepening the field — asking for more and dimmer stars around a focus |
| The sextant | Measuring a route between two meanings through the taxonomy |
| Skymarks | Bookmarks on stars |
| The word compass | The enabled languages, ringing the focused star as word chips |
| The course log | Your exploration trail — how you arrived at this meaning |
這一切絕非花俏裝飾;作者針對此工具的設計簡報已收錄 於紀錄中,值得再次引述:介面應是 「真正的 探索工具,而非玩具」 ——一張讓學習者或 研究者能真正探索的所有語言的地圖——而其來源應像一張 可供導航的紙質地圖,而非儀表板 [H](會話記錄,2026年9月 6日)。 秉持同樣的精神,儀表板上的元件皆刻意設計為 skeuomorphic:帶黃銅旋鈕的曝光計、六分儀測量、繪製好的 航線、時代戳記——這般舊式天文台的美學風格,旨在 透過觸感而非選單標籤來傳授知識。
8.3 What is on screen
該探索器已於 2026 年 9 月通過端到端驗證 [H],其功能包括:
- Search with sense disambiguation. 輸入 gato(西班牙語)後,系統會返回
meaning-stars;每個搜尋結果皆可顯示哪些語言中的哪些詞彙具有共同點 其意義——這塊展示家貓明星的展板呈現了它的 多語言同義詞集成員,例如:英語 cat 和 grimalkin、德語 Katze,日文 猫(第 8.5 節)。
- Travel. 點擊一颗星號(或按住 Shift 鍵點擊/按下小節鍵),以
它成為焦點;天空以它為中心重新調整,其周邊景象隨之顯現。
- The star panel. 該「焦點星球」各語言的成員人數,其
定義及其鄰域——針對大型鄰域則會進行分頁。
- The taxonomy lens. 追溯至恆星的「父母」(「這算是一種什麼」
「是哪種?」)或沿著該路徑向下探詢其子節點(「這類事物有哪些種類?」) 規範 is-a 族謂詞。
- The instruments(均為即時且已驗證):exposure dial 擴大了
分階段聚焦的恆星場(90 → 180 → 360 → 720 → 1,000 顆恆星), 無需重遊便能將更廣闊的天空融為一體;sextant 測量的是 兩個星號之間的有界圖路徑(第節中的 /graph/path 搜尋) 5.3),在天空中劃出一條虛線的金色航線,並記錄每段航程; skymarks 釘選星星(會本地儲存,因此你自己的迷你星座 (在重新載入後仍會保留);word compass 會用字詞環繞焦點星 圖示 — 每個啟用的語言對應一個圖示,點擊即可切換搜尋語言 語言;以及 course log, home bearing, epoch stamp, and reticle 讓您掌握情況 [H](會議紀錄,2026年9月7日)。
- The support affordance. 點擊「✦ 贊助」按鈕即可開啟捐款頁面
模態(第 10 節)。
8.4 Engineering the sky on 2014 hardware
介面的美感必須服從一項嚴格的限制:它必須能 在配備 2014 年世代處理器、8 GB 記憶體以及機械式 硬碟的機器上流暢運行——這台機器同時也是資料庫的託管主機。 使這一切 成為可能的工程技術值得記錄,因為它與第 7 節所描述的 bounded work 方法如出一轍,只是應用於像素 [H] 之上(稽核與會話日誌, 2026 年 9 月 6 日至 7 日):
- The page renders only on input. CPU 閒置使用率約為 0%;無任何運作
除非使用者採取行動,否則不會自動運作。並不存在永續的 動畫——這是「馬鈴薯預算」下的一項刻意選擇(第 9 節)。
- The nebula is baked. 裝飾性背景(紫色/青綠色/玫瑰色
(光暈與塵埃)會在每次調整大小時繪製一次,然後進行快取,並 在重新繪製時產生相機視差,而非每幀重新計算。
- Labels are rationed. 每幀僅繪製約 24 個星標 — 一個
標籤預算 — 確保重新繪製成本低廉且文字清晰可讀 [H](該 介面使用 MAX_LABELS = 24 來限定程式碼的放置位置; gui/planetarium-v1.html)。
- Requests are protected. 過期回應標記與中止控制
當使用者繼續操作時,取消飛行中的查詢;雙擊則暫緩處理 單擊操作,因此不會觸發多餘的資料擷取;調整大小時會進行防抖處理,並且 畫布的像素比例設有上限(將重新調整大小所佔用的記憶體從 (1080p 解析度下,從約 24 MB 降至約 11 MB)。
- Accessibility is explicit: canvas 角色與 aria 標籤、減少動態效果
在進行視覺調整的同時,也一併新增了支撐功能與鍵盤行程 波蘭語 [H](會議紀錄,2026年9月7日)。
8.5 The demo that ties it together
本專案的運行示範就是詞彙 cat —— 或者更準確地說,是 它所屬的概念。在瀏覽器中搜尋西班牙語 gato,前往該 星體,面板上便會顯示該同義詞集 princeton-wordnet:02121620-n 及其 在各活語言中的成員。 實際上於 2026 年 9 月 6 日至 7 日的無頭測試中 經端到端驗證的子集已記錄於測試日誌中—— 英語 cat, grimalkin 與 felis silvestris catus(科學名稱 WordNet 儲存庫)、德語 Katze、西班牙語 gato、日語 猫 —— 以及 資料庫針對該同義詞集儲存的更廣泛成員清單(例如:英語 housecat, mouser, puss, tomcat;法語 chat, chatte; 德語 Kater; 日語 ネコ;葡萄牙語 gato, bichano)則源自匯入的 WordNet 成員關係,而非端到端測試日誌;若讀者欲獲取 完整的當前清單,可重新執行第 7.3 節的接受查詢 [H with [NV] on the untested tail] 中的接受查詢(無頭端到端日誌與即時資料庫, 2026年9月6日至7日)。 一顆星,六種語言,一個含義:2025年12月的 直覺,清晰呈現在螢幕上。此示範的英文部分 正是第7.2節中的錯誤曾短暫中斷的內容:一次由西班牙語驅動的gato 搜尋始終能找到該星號,而由英文驅動的 cat 搜尋則僅在 覆蓋範圍修復後才 能運作,且第 7.3 節的驗收腳本 正是為了按需證明,cat · gato · 猫 共享著 同一顆星號。
9 · The workbench: tools, workflow, and the "potato" machine
若不提及該專案所依賴的工作台,其發展歷程便不完整。 Lingua Mundi 的工作台相當特殊,而它所帶來的限制,塑造了 本文中幾乎每一項工程決策。
9.1 The potato
託管資料庫、API、介面以及 開發環境的機器是一台普通的消費級筆記型電腦:華碩 X751MA,配備 Intel Pentium N3540 (Bay-Trail, four cores, no AVX2), 、8 GB 記憶體 (可用空間 7.6 GiB)、一台 5400 rpm hard disk,以及網速約為 47 KB/s 的上行連線——此資料係於 2026 年 9 月 7 日為撰寫本文而即時擷取 ([H],機器本身顯示為 lscpu//proc/meminfo)。 該專案的 筆記中,這台機器時而被描述為 Atom Z36xx/Z37xx,時而被描述為 Pentium N3540 —— 實際上是同一個 Bay-Trail 晶片家族,僅名稱不同 [O];2026 年初的聊天記錄亦提及另一種規格 (一台 Intel Jasper Lake「N5105」機器),第 10.2 節將此列為 尚未解決的硬體記錄衝突。 該工作室親暱地稱這台實機為 the potato ——並制定了一項貫穿所有 紀錄的規則: one heavy operation at a time,具備記憶體保護的封裝程式、不允許持續 運行動畫、不使用過早建置的基礎架構(第 4.5 節),且每項重度任務 皆以自報完成的獨立腳本形式執行,待任務完成後主動回報, 而非被輪詢 [H](工作階段日誌與工具集,2026年9月)。 「烘焙,勿重新推導」模式(第7節)、僅輸入的介面 (第 8.4 節),以及零 LLM 成本的研究平台(第 9.4 節),這些 歸根結柢都是「馬鈴薯」帶來的結果——證明了緊縮的預算可以成為 設計上的優點,而非限制。
9.2 The software stack
運行中的系統(已於 2026 年 9 月實機驗證 [H]):PostgreSQL 16 作為單一資料儲存庫(第 4.5 節),FastAPI(Python)作為 API 層,SQLAlchemy + Alembic 用於模型與遷移,Python 腳本 用於匯入工具與實體化檢視的管理,以及一個小型 無依賴性的網頁介面(HTML/CSS/JavaScript),由同一 來源提供服務。 輔助機制包含 systemd 項使用者服務,用於維持 API 以及記憶體/熱管理防護機制的運作(第 9.5 節)、每日對程式碼庫進行的 GitHub 備份、作為專案記憶體的 Obsidian 知識庫 (第 9.3 節)、針對介面的無頭 Chromium 端到端檢查,以及 工作室的 detach-run + notify 工具集,用於自發警報的背景 工作 [H](服務與工具清單,2026年9月)。
9.3 The knowledge base: a project memory that can be audited
自 2026 年 8 月 26 日起,作者及其代理人維護了一個結構化的 知識庫(一個 Obsidian 保險庫),其中每次工作時段皆會 被記錄: 已完成的工作、做出的決策、後續行動,以及每個 事實的來源檔案,前言部分則記錄了來源出處並標註 verified: true/false 標記 [H](金庫規範,2026年8月至9月)。 正因 有這個資料庫,本論文才得以引用具體日期與引文:當這份 草稿寫著「工作記錄,2026年9月6日」時,它所指的正是 確實存在、於該日撰寫且附有自身來源註記的檔案。 該 資料庫有兩項規範值得特別提及 method:每項陳述 均須註明來源,且絕不捏造歷史——未經證實 的內容雖會保留,但會標記為「未經核實」[H](資料庫規範)。 這些 規範即為本文所遵循的規範(附錄 A)。
9.4 Zero-token research and the local-first rule
作者的既定原則——可見於 2026 年 8 月 29 日的專案備註中—— 是讓本地 API is 成為研究主場:/lexemes、/concepts、 /analyze 運用 zero LLM tokens 所耗費的 [H] 來回答關於語料庫的問題。同樣的「在地優先」原則也適用於資料(一切 皆自行託管;不依賴任何供應商)、資金(僅限免費方案與開放資料 ; 第10節),以及隱私(機密資訊絕不離開機器; 知識庫屬私有)[H](會話記錄,2026年9月)。
9.5 Guardrails on a fragile machine
由於「馬鈴薯」沒有頭部空間,工作室因此搭建了護欄,而這些護欄 本身便是這項工程故事的一部分:一個 memory/thermal guard (tools/mem-manager.sh, v2, 2026年9月7日上線) 機制,當可用記憶體低於 900 MiB 或 80 °C 時發出警告,並在低於 500 MiB 或 88 °C 時 選擇性地釋放背景單元,此外還包含一個系統層級的 早期 OOM 終結者(earlyoom -m 8 -s 5,即當可用記憶體跌破 8% 時觸發,間隔為 5 秒)[H](即時設定: mem-manager.sh 閾值與 /etc/default/earlyoom,參見 2026年9月7日)。該工作室的運作規則確保 這些防護機制永遠無需啟動:one heavy operation at a time、 具備記憶體保護功能的封裝程式,以及針對所有 長期執行任務所設的自警式分離式工作。 長時間的修復作業會以 idempotent 方式編寫(取或創, 若存在則跳過),以便任何中斷——無論是重新啟動、斷電,還是防護機制 跳閘——所造成的代價僅是時間:修復程序只需重新啟動,便能 完成任務(第 7.3 節)。同樣的紀律將並發本身 視為一種需進行資源規劃的資源,如同記憶體或磁碟一般。
9.6 Governance: licenses, attribution, and the "free forever" decision
Lingua Mundi 中每個資料集在輸入時均附有其授權條款紀錄( 儲存庫的 docs/DATA_LICENSES.md 清單;即時資料庫的 source 資料表)[H]:WordNet(寬鬆授權)、Open Multilingual Wordnet (按語言區分的授權條款,主要為 CC BY-SA 和 CC BY),Wiktionary 以及 kaikki(CC BY-SA,附帶 GFDL 遺留條款),Wikidata(CC0),UniMorph (CC BY-SA 3.0)、Universal Dependencies(CC BY-SA 4.0)、JMdict/KANJIDIC2 以及 EDRDG 系列(寬鬆授權,需標示來源)、OPUS (按資料集),CLICS 及詞頻清單(按來源),等等 [H](授權清單, 2026年9月查閱)。該計畫亦秉持互惠原則:其產出成果 亦計畫以自由授權形式釋出。
該 funding model 於 2026年8月底至9月初的九天內公開進行,相關紀錄顯示了每個步驟 [H](會議 紀錄與行事曆,2026年8月29日–9月7日):最初計畫於 8月29日販售一款離線版 Core-6 辭典應用程式 (Texupan, 29 美元或每月 9 美元)的初步計畫;9 月 1 日前在 store hub 上發布 附有付款連結的商店列表;以及——截至 9 月 7 日——決定將 Lingua Mundi free forever,由自願 捐款資助,該Stripe產品的名稱直譯為 「Lingua Mundi — 讓它 永遠免費」, 一次性價格為 5 歐元/15 歐元/50 歐元,月費為 3 歐元/9 歐元/25 歐元,並設定 一個誠實的年度目標 €2,400,用以支付基礎設施費用及下一種 語言的資料建置工作 [H](會議紀錄,2026 年 9 月 7 日)。 該帳戶 是刻意以 dormant 的方式設立的——在作者 完成支付服務商的身分驗證前,捐款功能將保持停用——因此「永遠 免費」在作者的敘事框架中,是一種 verifiable claim,而非口號 [H](會話記錄,2026年9月7日)。 身分驗證於 2026 年 9 月 8 日完成,六個付款連結於當日上午啟用;這些連結已發佈於商店的資金專區 [H](Stripe 帳戶紀錄與付款連結歷史,2026 年 9 月 8 日)。 對外公開的文字遵循 「工作室之聲」原則(前言)與「誠實文案」原則:不誇大其詞,不 過度宣稱——這與規範資料庫及本文的準則如出一轍。
10 · Where the project stands (7 September 2026), its honest limits, and its road ahead
10.1 Current state of the system
於 2026 年 9 月 6 日至 7 日 [H] 直接針對正式運作系統進行測量(具體查詢內容請參閱 附錄 A):
- Corpus (pre-repair snapshot, 6–7 September 2026): 96,434 個概念 · 1,238,383 個詞素 · 1,608,018 個詞義 · 171,672 個關係,涵蓋六種現役語言(英語、西班牙語、法語、德語、葡萄牙語、日語)——該SQL 計數值在兩次測量日期中均完全相同。
- Corpus (post-repair, 8 September 2026): 125,980 個概念/125,980 個同義詞集/352,333 個英文詞素,詳見修復報告(
lm-en-coverage-REPORT-2026-09-08.txt、RESULT: PASS); cat 星級princeton-wordnet:02121620-n的多語言成員涵蓋英語、西班牙語、日語、德語及葡萄牙語(cat、gato、猫、Katze、Gato doméstico)。 - Ranking views:
concept_sky_rank94,498 行;concept_lang_rank
218,120 行;concept_word_rank 建立時為 338,378 行(即時重新計數) 標準資料庫角色被拒絕;已標記為 [NV])。
- Performance: 預設天空 ≈ 0.25 秒暖色(排名前 8.6 秒)
瀏覽次數);包含 1,000 顆星的深度查詢,若包含文字則約需 1.1 秒(若不含文字則需 >60 秒) 檢視);圖路徑搜尋所需時間以毫秒為單位;搜尋時間 ≈ 0.5 秒(預熱狀態)/≈ 10 秒 硬碟的頁面快取中處於冷狀態。
- Interface: 語義圖譜瀏覽器現已於 API 的網站主站上線,具備
所有儀器(曝光轉盤、六分儀、天體標記、文字羅盤、航向 (日誌、時代戳記)經 23/23 次無頭瀏覽器端到端檢查驗證,檢查對象為 2026年9月6日至7日。
- English coverage repair: 無上限的英語 WordNet 重新匯入、關聯、整合、檢視更新及端對端驗證鏈 (第 7.3 節)於 2026 年 9 月 7 日上午啟動,並於 2026 年 9 月 8 日 22:19(2026-09-08 22:19:12)順利完成。 其驗收關卡已通過:該鏈的自有報告(
lm-en-coverage-REPORT-2026-09-08.txt、RESULT: PASS)記錄了與概念相關的英文cat詞義在princeton-wordnet:02121620-n上的呈現,其多語言成員包括 cat、gato、 猫、Katze、Gato doméstico [H](報告,2026年9月8日)。 - Governance: 捐款頻道已上線 — 身分驗證已於 2026 年 9 月 8 日完成,商店中已發布六個付款連結;
對作者的支付服務商驗證;每日備份程式碼庫; 知識庫已更新。
10.2 What is honestly not known, and what is unresolved
根據本工作室的驗證規範,本文必須明確指出 無法驗證的內容,並記錄各來源之間的矛盾之處。其中 重要的包括:
- The "Core 6" discrepancy. 作者的個人語言集(記錄於
(2026年8月29日)支援西班牙語、英語、日語、法語、Italian 以及 葡萄牙語。即時資料庫支援的六種語言分別是英語、西班牙語、 法語、German、葡萄牙語和日語。德語取代了義大利語在 該資料庫已無任何現存的書面說明;義大利語 row 和 Italian 資料集先前已進行註冊,但即時資料表中仍包含 德語 [H],理由為 [NV](另請參閱第 4.2 節關於 規格中的等級,其中包含普通話和義大利語,但不包含德語—— (三個月內發表的三組不同語言資料集)。
- Corpus-count drift within a single day. 一份於……撰寫的技術文件
2026年9月6日的數據顯示有1,146,066個詞素/1,595,537個詞義,而 當晚的直接 SQL 報告顯示 1,238,383 / 1,608,018(概念與 關係相同:96,434 / 171,672);該次會話的日誌 「evening」還包含第三類、居中規模的詞項(約115萬個詞素), 這與當天仍持續抵達的進口貨物情況一致。各語言的總計 與 SQL 這個數字相符,因此該檔案中的數字似乎來自 不同的時刻或濾鏡;這種差異在 記錄 [H] 與對帳 [O]。本文引用了 SQL 張附有日期的圖片。
- Hardware records conflict. 託管即時系統的機器位於
本文直接採用 2026 年 9 月的 ASUS X751MA 作為範例 搭載 Intel Pentium N3540(Bay-Trail)處理器,8 GB 記憶體(第 9.1 節) [H]。書面紀錄則較為雜亂:專案筆記中描述了這個盒子 作為 Intel Atom Bay-Trail(Z36xx/Z37xx)以及 Pentium N3540 —— 該 同一代矽晶片以兩個行銷名稱推出 [O] —— 雖然較早的 2026 年的對話紀錄提及的是一台不同的機器,即 Intel Jasper Lake "N5105" 配備 12 GB 記憶體(2026 年 1 月)及之後的機型,如 「Jasper Lake 4 晶片」(2026年5月)以及「Intel Jasper Lake N5105,4 GB」 (2026 年中記憶體檔案)。Jasper Lake 並非 Bay-Trail 架構的矽晶片,因此該 這些記錄描述的要麼是這一年間的兩台不同機器,要麼是 助理標記錯誤;現存的證據無法判定究竟是哪一種情況,而且 重點在此被標示出來,而非被[H]用 對帳 [NV](會話日誌與 AI 對話紀錄, 2026年1月至9月)。
- Data-quality warnings from the September audit: 該語料庫包含
178,576 組重複的詞條對;124,790 個無詞義的詞素;佔 定義為空;且(在英文版本修訂之前)71.7% 的詞義尚未 與概念相關聯。同一項稽核發現,參照完整性得以維持 在整個過程中(總和精確,資料庫層級無懸空/孤立行): 71.7% 這個數字描述的是 not yet linked to a concept 種感覺,該 設計的是「可見孤行」狀態,而非連結失效——這是一個誠實的 該專案在進行對齊作業時,刻意讓這項區別保持可見 續 [H](審計,2026年9月5日至6日)。
- Unmeasured or pending: 在「馬鈴薯」以外的硬體上的效能
從未進行過測量;該專案目前尚無公開使用者,因此 沒有實際使用指標;該工作室的法律架構並未記載於 相關紀錄;關於「南北韓」建模的問題、粵語數據匱乏, 此外,台灣 WordNet 授權審查程序已開放(第 10.3 節)。
10.3 The road ahead
這份於 2026 年 8 月 29 日經使用者核可的路線圖,是 6 月 手稿中七張圖表 [H](專案備註)的成熟版本: 音韻學/音系學、 形態學(已導入)、句法學(已導入)、語義學(已導入)、辭書編纂 (導入)、語料庫(導入),以及——已排入待辦清單——話語、詞源學,以及 對應層與用法層,再加上日後將推出的公開網頁介面。在 近期內,已記錄的計畫如下 [H](會議紀錄,2026年9月7日 ):
- The CJKV family. 該架構接下來計畫納入的語言有:
普通話(cmn)、粵語(yue)、韓語(kor)和越南語(vie)。他們的 時程取決於一項誠實的資料可用性勘查 關於開放數據領域所提供的內容:OMW Wiktionary 詞網確實存在 針對普通話(19,079 行)、粵語(527)、韓語(9,268)以及 越南語(5,498);UD 樹庫中的普通話(123,000 個詞元)及粵語 (1.4萬),韓語 (8萬 GSD 加上 35萬 KAIST),越南語 (5.8萬)。粵語是 稀缺的那種——沒有大型詞網、樹狀庫規模小——以及台灣的 Wordnet 的授權目前正在審查中 [H](會話記錄與資料 清單,2026年9月7日)。目前尚未有任何 CJKV 資料集被匯入至該 截至本草案為止的即時語料庫;該家族的時程安排尚待決定 在該項審查完成之前。
- Research-v1 interface panes(詞彙透鏡、血脈攀升、場牌、
(筆記本、比較表)已於 6 日設計完成並獲得後端部門核准 2026年9月,排在儀器組裝 [H] 的後面。
- Publication. 本文是由人工智慧生成的初步草稿;該
由人類撰寫的出版物目前正在編纂中(前言部分)。
- Languages without end. 此架構的承諾——將一種語言納入其中
row plus 數據集——這是該專案所宣示的長期目標,而 募款說明中直截了當地提到:Lingua Mundi 最初提供六種語言, 設計上可無限期新增這些項目 [H](會議紀錄,2026年9月7日)。
10.4 Conclusion
這一切始於 2025 年 12 月 3 日一則索取免費辭典檔案的請求,如今已發展成 一張基於開放資料、可持續運作且可供查詢的六種語言意義地圖,由 一人僅憑免費工具與一台 2014 年的筆記型電腦所建構而成。 推動這個專案的理念—— 「意義是多語言數據的自然單位」;「對齊必須 明確且標註,絕不能默默推測」;「昂貴的運算 應「一次處理,多次讀取」;預算限制是 一種設計工具;無論在資料庫或論文中,每項陳述都應附有 來源與日期——這些理念雖非嶄新,但它們是true,而這個專案 證明了一人確實能將這些理念付諸實踐。 其最具價值的成果 或許根本不是那個資料庫,而是證明了一位獨立研究者能夠 在公開場合建構誠實的基礎設施:測量他所測量的內容、標註 他所標註的日期、展示他的「孤兒」條目,並信守承諾——一顆星、六 種語言,以及前方仍舊遼闊的整片星空。
Built in a cave, with a bunch of scraps.
References
APA 第 7 版。參考文獻詳情已於 2026 年 9 月 7 日依據出版商網頁 及數位物件識別碼(DOI)紀錄進行核對。軟體與資料 來源均依照 APA 的軟體/資料集引用格式進行標註。(僅列出 正文中引用的文獻。)
Bond, F. 及 Foster, R. (2013)。 連結與擴展開放式多語言 WordNet。收錄於《計算語言學協會第51屆年會 會議論文集》(第1352–1362頁)。計算語言學協會。 https://aclanthology.org/P13-1133/
美國盲文學院。(2019)。Atkinson Hyperlegible [電腦 字型]。https://brailleinstitute.org/freefont
Breen, J. W. (2004). JMdict:日語-多語種辭典。收錄於 《多語種語言資源研討會論文集(COLING 2004)》(頁 65–72)。COLING。 https://aclanthology.org/W04-2209/
電子辭典研究與開發小組。(未註明日期)。JMdict / EDICT 日英辭典專案 [資料檔案與文件]。 於 2026 年 9 月 7 日取自 https://www.edrdg.org/jmdict/edict_doc.html
Fellbaum, C.(編)。(1998)。WordNet: An electronic lexical database。麻省理工學院 出版社。https://mitpress.mit.edu/9780262561167/wordnet/
Gaia 合作團隊、布朗(Brown, A. G. A.)、瓦萊納里(Vallenari, A.)、普斯蒂(Prusti, T.)、德·布魯因(de Bruijne, J. H. J.)、巴布西奧(Babusiaux, C.)、……茨維特(Zwitter, T.)(2018)。 蓋亞資料發布第 2 版: 內容與觀測特性摘要。Astronomy & Astrophysics, 616, 文章 A1。https://doi.org/10.1051/0004-6361/201833051
Hernández, R. (2026年6月1日)。Lingua Mundi:一種用於 概念錨定語言模型的語義基礎架構(第1至7版)[未發表手稿; 修訂與審核紀錄存於作者的對話紀錄 檔案庫中]。
Hernández, R. (2026年7月24日)。多語言詞彙平台 — 工程 規格書 (第2.0版) [未發表的規格書;文本 已從檔案中擷取]。
Kirov, C., Cotterell, R., Sylak-Glassman, J., Walther, G., Vylomova, E., Xia, P., 法魯基(M.)、米爾克(S. J.)、麥卡錫(A.)、庫布勒(S.)、雅羅夫斯基(D.)、 艾斯納(J.)與胡爾登(M.)(2018)。UniMorph 2.0:通用形態學。收錄於 第十一屆語言資源與評估國際會議 (LREC 2018)論文集。歐洲語言資源協會。 https://aclanthology.org/L18-1293/
麥卡錫(McCarthy, A. D.)、基洛夫(Kirov, C.)、格雷拉(Grella, M.)、尼迪(Nidhi, A.)、夏(Xia, P.)、戈曼(Gorman, K.)、 維洛莫娃,E.;米爾克,S. J.;尼古拉伊,G.;西爾夫韋伯格,M.;阿爾漢格爾斯基, T.;克里扎諾夫斯基,N.;克里扎諾夫斯基,A.;克利亞奇科,E.;索羅金,A.; 曼斯菲爾德,J.、埃爾恩斯特雷茨,V.、平特,Y.、雅各布斯,C. L.、…… 雅羅夫斯基,D. (2020)。UniMorph 3.0:通用形態學。 收錄於 第十二屆 國際語言資源與評估會議(LREC 2020)論文集 (第 3922–3931 頁)。歐洲語言資源協會。 https://aclanthology.org/2020.lrec-1.483/
Meyer, C. M. 與 Gurevych, I. (2012)。Wiktionary: 專家編纂詞典的新競爭者?探討協作式 詞典編纂的可能性。 收錄於 S. Granger 與 M. Paquot(編),Electronic lexicography (第 259–292 頁)。牛津大學出版社。 https://doi.org/10.1093/acprof:oso/9780199654864.003.0013
Miller, G. A. (1995). WordNet:一個英語詞彙資料庫。 Communications of the ACM, 38(11),39–41。 https://doi.org/10.1145/219717.219748
Nivre, J., de Marneffe, M.-C., Ginter, F., Hajič, J., Manning, C. D., Pyysalo, S., Schuster, S., Tyers, F., & Zeman, D. (2020). 《通用 依存關係 v2:一個持續擴充的多語言樹狀庫彙編》。收錄於 第十二屆國際語言資源 與評估會議(LREC 2020)論文集(第 4034–4043 頁)。歐洲語言資源 協會。https://aclanthology.org/2020.lrec-1.497/
普林斯頓大學。(未註明日期)。About WordNet. WordNet. 於 2026 年 9 月 7 日檢索自 https://wordnet.princeton.edu/
SIL International。(未註明日期)。ISO 639-3。於 2026 年 9 月 7 日檢索自 https://iso639-3.sil.org/
德·索緒爾,F.(1983)。Course in general linguistics(C. 巴利、A. 塞謝海耶與 A. 里德林格 編;R. 哈里斯 譯)。達克沃思出版社。 https://www.bloomsbury.com/us/course-in-general-linguistics-9781472508829/ (原著出版於 1916 年)
Speer, R. (2022). *wordfreq:多國語言詞頻資料庫
- (第 3.0 版) [電腦軟體]。GitHub。
https://github.com/rspeer/wordfreq
Tiedemann, J. (2012). OPUS 中的平行資料、工具與介面。收錄於 第八屆國際語言資源 與評估會議(LREC 2012)論文集(第 2214–2218 頁)。歐洲語言資源 協會。https://aclanthology.org/L12-1246/
Vrandečić, D., & Krötzsch, M. (2014). Wikidata:一個免費的協作式 知識庫。Communications of the ACM, 57(10),78–85。 https://doi.org/10.1145/2629489
維基媒體基金會。(未註明日期)。Wiktionary: The free dictionary。檢索於 2026年9月7日,來源:https://www.wiktionary.org/
Zipf,G. K.(1949)。Human behavior and the principle of least effort。 艾迪生-衛斯理出版社。https://archive.org/details/humanbehaviorpri0000zipf
Appendix A · Sources, method, and verification
A.1 The annotation convention
遵循本工作室的嚴謹標準(源自其調查 工作),本文中凡是讀者需要了解其 認識論地位的論點,均會標註如下:[H] = 經核實的事實 — 指本文所參考的測量數據、程式碼或 附有日期的來源;[O] = 經歸因之詮釋或 意見;[NV] = 未經核實/未查得。摘要 及正文中所有圖表,均為附有日期之[H]測量數據,或已標註來源。
A.2 Source families consulted (access 6–7 September 2026)
| # | Source | What it provided |
|---|---|---|
| 1 | Live codebase: …/SafeMode/Software Development/LinguaMundi/lingua-mundi (api/, core/, schemas/, importers/, scripts/, docs/, gui/) | Architecture, schema, importers, materialized-view SQL, API routes, GUI code |
| 2 | Live database lingua_mundi (PostgreSQL, 127.0.0.1:5433), direct SQL | Corpus counts, language table, synset membership, concept links |
| 3 | Live API (127.0.0.1:8765): /languages, /graph/sky, /graph/star, /graph/word, /graph/path, /openapi.json | Endpoint behavior, warm/cold latencies, gzip |
| 4 | Web interface (127.0.0.1:8765/gui) + headless-browser checks | UI behavior; 23/23 end-to-end checks recorded 6–7 Sep 2026 |
| 5 | Vault knowledge base (session logs 26 Aug–7 Sep 2026, handoffs, project notes, conventions) | Milestones, decisions, quotes, conventions, dates |
| 6 | ChatGPT conversation archive (export 5 Sep 2026; 421 conversations with content) | Origin and growth conversations, verbatim quotes (Section 1, 3, 4) |
| 7 | DeepSeek data export (6 Sep 2026; 215 conversations) | June 2026 manuscript revision cycle, setup logs |
| 8 | Claude.ai data export (extracted 6 Sep 2026; legacy-memory file updated 7 Sep 2026) | Long-horizon context, project roles |
| 9 | Personal artifacts in the author's home directory (file timestamps, scripts, specification PDF, journals) | Pre-project chronology (Nov–Dec 2025), engineering specification, journals |
| 10 | Published scholarly and data sources (see References) | Background and related work |
代表性驗證查詢(執行日期:2026年9月7日,角色 lingua): SELECT count(*) FROM concept|lexeme|sense|relation → 96,434 / 1,238,383 / 1,608,018 / 171,672; SELECT code FROM language → 德語、英語、法語、日語、葡萄牙語、 西班牙語;各語言在詞義集 02121620-n 中的成員資格(第 8.5 節);該 專案專屬的接受腳本 verify-lm-cat-demo.sh(第 7 節)。
A.3 Key numbers with dates (compressed timeline)
| Date | Event / figure |
|---|---|
| 2025-11-11 | KANJIDIC2 downloaded (first dataset, file timestamp) |
| 2025-12-03 | Origin message: "unified multilingual database" (ChatGPT log) |
| 2025-12-05 | OMW data downloaded; first extract scripts |
| 2025-12-08…16 | Merge/unified pipeline; four-entity (concept/sense/lexeme/grapheme) JSONL schema |
| 2026-05-01 | OMW v2.0 coverage study |
| 2026-05-23 | "Multilingual Lexical Platform" spec master (markdown) |
| 2026-06-01 | Lingua Mundi named; manuscript V1–V7 revision cycle (DeepSeek + ChatGPT audits) |
| 2026-07-17/18 | Code scaffolding; feasibility conversation; journal |
| 2026-07-24 | Engineering Specification V2 (104 pp., PDF) |
| 2026-08-13 | Lean-stack decision; semantic interaction layer |
| 2026-08-19…25 | Japanese demo builds; 23 Aug concept descriptions |
| 2026-08-27 | Daily GitHub backups begin |
| 2026-08-29 | "LinguaMundi IS the lexicon" decision; roadmap approved; Core 6; Postgres live; UD importer |
| 2026-08-30 | API routes (CORS, /lookup, /kanji); 27 tests green; first /gui deploy |
| 2026-08-31 | Import restart (~1.13M rows); English OMW cap seeded the cat bug |
| 2026-09-01 | Planetarium naming; ≈1.54M rows; store live |
| 2026-09-05 | Deep audit; pagination fixes; 1,238,383 lexemes |
| 2026-09-06 | Enrichment audit; materialized-view overhaul (94,498 / 218,120); words bake (338,378); GUI pivot to semantic-graph explorer; cat root cause; research-v1 approval |
| 2026-09-07 | Instruments live (23/23 E2E); donation setup (dormant); English coverage repair chain launched; CJKV data-availability reconnaissance; this paper drafted |
| 2026-09-08 | English coverage repair verified complete (8 September 2026 at 22:19); acceptance gate PASS recorded in lm-en-coverage-REPORT-2026-09-08.txt |
A.4 Contradictions and unresolved items
如第 10.2 節所述:義大利語/德語 Core-6 數據差異; 同日語料庫計數偏差(檔案 1,146,066 對比 SQL 1,238,383 個詞素, 當晚的會話日誌中還出現了第三個中間數值, 已按語言分別與 SQL 的數值進行了對帳);硬體記錄衝突 (Atom Bay-Trail 對比 Pentium N3540 對比 2026 年早期記錄中的 Jasper Lake N5105 ——第 10.2 節第 3 項);71.7% 的未關聯詞義以及 其他資料品質警示; 以及未經核實/未記錄的項目: 8月26日之前的精確 儲存庫創立日期、語言集變更的原因、 6月1日審計文本的模型來源(這些審計記錄保留在 作者從用戶端存取的 ChatGPT 對話中;但出口記錄中並未獨立證實是哪個助手模型 撰寫了哪一輪審計,在匯出檔案中並無獨立佐證 — 參見第 3.3 節)、concept_word_rank 即時重新計票(權限遭拒), 以及該工作室的法律結構。
A.5 Methodology notes
- 被測系統 is 即生產系統;暖測會進行
±0.3 秒的硬碟雜訊;日期與時間以記錄本身的格式標示 時區(除非另有註明,否則為中部時間;DeepSeek 日誌使用 +08:00,且曾 (已轉換))。
- 引文均為引自所引用日誌/檔案的原話;省略號表示省略部分;
西班牙語引文在使用處的正文中均附有英文註釋。
- 本文本身即為由人工智慧生成的草稿(前言說明);它是由
本著作係在作者指導下,根據上述資料撰寫而成,且並未 已通過同儕審查。驗證工具:直接 SQL、HTTP 查詢、 無頭瀏覽器檢查及原始碼檔案讀取;未據此提出任何索賠 當來源尚存在時的記憶。
Appendix B · Glossary — plain-language terms used in this paper
How to use this glossary: the first time a technical term appears in the paper it is underlined with dots — hover it (or tap it) for a quick definition, or click it to jump here. This list is alphabetical.
- Alignment — 指認定某種語言中的某個詞語與另一種語言中的某個詞語具有相同含義的行為。
- API — 一種介面,可讓一個程式向另一個程式查詢資料(例如,辭典應用程式向 Lingua Mundi 資料庫查詢某個單字)。
- Autonym —— 該語言母語者對其的稱呼(西班牙語使用者將西班牙語稱為 español)。
- Bake —— 該專案中用來描述「將耗時計算的結果計算一次、儲存起來,然後多次讀取」的術語(運作準則是「預先計算,勿重複推導」)。
- Breadth-first search — 一種像石頭投入水中產生的漣漪般,以層層向外擴散的方式探索圖,藉此找出兩點之間最短路徑的方法。
- CJKV — 這是涵蓋中文、日文、韓文及越南文的書寫系統家族的簡稱(這些字母代表各書寫系統的名稱)。
- Concept —— 一種跨越語言的共同涵義(在本論文中,指「家貓的概念」,而非任何特定詞彙)。
- Corpus — 一套用作證據的大型語言資料集(包含文本或辭典條目)。
- Dataset — 來自單一來源、具有自身格式與授權的一組封裝資料。
- Derivation / etymology — 派生是指如何從現有詞彙中構建新詞(例如 run → runner);詞源則是指一個詞在不同時代與語言中的發展歷史。
- ETL — 萃取-轉換-載入(ETL):從外部來源讀取資料、重新塑形資料,並將其儲存至資料庫的過程。
- FastAPI — 一個免費的開源 Python 框架,用於建構本專案所提供的這類介面 (API)。
- Full-text search — 透過比對儲存文字中的詞彙來搜尋資料庫,而非透過精確的識別碼進行搜尋。
- Grapheme —— 一個書寫符號:字母、音節符號或漢字。
- Graph — 在本文中,指一組透過帶類型關係(邊)相互連接的意義(節點)。
- Gzip — 一種標準的壓縮方法,可在檔案透過網際網路傳輸前縮小其大小。
- HTTP — 網頁瀏覽器和 API 用來透過網際網路請求和接收資料的通訊協定。
- Hypernym / taxonomy — 上層類別 = 「某種」:feline 是 domestic cat 的上層類別。分類體系即是由各類所構成的樹狀結構。
- Importer — 一個懂得如何讀取一個外部資料集,並將其寫入 Lingua Mundi 自身資料結構的程式。
- Index — 一種資料庫結構,能讓查詢快速找到資料列,就像書中的索引,而不必逐頁翻閱。
- Inflection / morphology — 屈折變化是指為了符合語法而改變詞形(run → ran);形態學則是研究這些詞形。
- Instance-of / part-of — 圖中存在兩種關係類型:「這是某類事物的其中一個例子」(貓是哺乳動物類別的一個實例)以及「這是某事物的組成部分」(爪子是貓的一部分)。
- Interlingua — 語言間的共享中間表徵:與其直接將西班牙語翻譯成英語,不如先從西班牙語→語義→英語來進行轉換。
- ISO 639-3 — 一項國際標準,為每種人類語言分配一個獨一無二的三字母代碼(
spa= 西班牙語,jpn= 日語)。 - JMdict / KANJIDIC2 —— JMdict 是一部大型日文與多語種辭典;KANJIDIC2 則是其配套的漢字(日文中所使用的漢字)檔案,內含讀音與釋義。
- JSON Lines — 一種簡單的純文字格式,每行代表一個資料記錄,用於專案最早期的管線檔案。
- Kaikki — 這是從 Wiktionary 資料中提取出的機器可讀格式,相較於原始頁面,更便於程式讀取。
- Kanji — 日語書寫中使用的源自中國的漢字。
- Lemma — 詞彙的辭典形式(即您用來查閱的形式:cat,而非cats;run,而非ran)。
- Lexeme — 某種語言中的詞形(字串 cat)。
- License — 說明資料可如何使用與分享的法律條款;「開放」授權允許在標示出處的前提下重新使用(例如 CC BY-SA)。
- Long tail —— 齊普夫分佈(參見Zipf定律)最遠端的大量稀有項目。
- Materialized view — 一個儲存且預先計算好的查詢結果,會依照排程進行更新,因此重複的查詢無需重新執行計算(即「bake」模式)。
- Morphology —— 研究詞形及其在語法上的變化(參見「屈折」)。
- Natural language — 指人們實際口說和書寫的人類語言,有別於程式語言。
- Node / edge — 在圖中,節點代表一個項目(此處指一個概念),而邊則是兩個項目之間的連結(此處指帶有類型的關係)。
- OMW / Open Multilingual Wordnet — 與英語 WordNet 對齊的詞網集合。
- OPUS — 一份從網路及電影字幕中蒐集而來的大量翻譯句子彙編。
- Orphan sense — 尚未與共享概念建立關聯的詞典定義;保持可見狀態,而非隱藏。
- Pagination — 將冗長的結果清單拆分為編號頁面,而非一次傳送所有內容。
- Part of speech — 詞的詞性:名詞、動詞、形容詞等。
- Pipeline — 一系列程式,將資料從原始來源經由清理步驟,最終存入目標位置。
- Plugin / registry — 外掛程式是針對單一資料集的小型附加程式;註冊表則是這些外掛程式的唯一權威清單。
- Polysemy — 一個詞彙具有多種含義(bank:河岸/銀行存款)。
- PostgreSQL — 一個免費、開源的關係型資料庫(系統 Lingua Mundi 將所有資料儲存於此)。
- Relation — 兩個概念(家貓 is a 貓科動物)之間的一種具類型且有向的關聯。
- Schema — 資料庫的藍圖:包含哪些資料表、每筆記錄儲存哪些資料,以及資料表之間如何相互關聯。
- Sense — 一本辭典所收錄的某個詞彙的一個意思。
- Signifier / signified — 索绪尔所提出的詞語的雙重面向:其聲音或形貌(能指)及其所指涉的概念(所指)。
- Sky brightness / magnitude — 該專案根據某個詞義所關聯的語言和詞彙數量,對其「重要性」所做的評級。
- SQL — 用於向關係型資料庫提問的標準語言。
- Synset — 一組在特定語境中能表達相同意義的詞彙;在 Lingua Mundi 中,同義詞集的意義以「概念」的形式儲存。
- Token — 在機器學習中,指模型讀取或寫入的短小文字片段(通常為一個單字或單字的一部分)。
- Treebank — 一組附有語法標註(哪些詞彙扮演哪些角色)的真實句子集合。
- UD / Universal Dependencies — 一個以開放授權方式發布多種語言、附有文法標註的句子數據的社群專案。
- UniMorph — 一個收錄詞形(屈折)資料的多語言資料庫。
- URI — 某事物的穩定且唯一的地址,此處用於概念(例如,
princeton-wordnet:02121620-n代表家貓)。 - Wikidata — 維基媒體的結構化知識庫,收錄附有機器可讀識別碼的陳述,並以 CC0 授權發布。
- Wiktionary — 由維基媒體基金會所營運的協作式辭典。
- Word form — 某種語言中某個詞彙的一種拼寫方式;參見「語素」。
- WordNet — 原始的、按英語語義組織的詞彙資料庫(普林斯頓);OMW 將其他語言與其對照。
- Wordfreq — 一個涵蓋多種語言的詞彙頻率清單資料庫,用於根據詞彙的使用頻率對其進行排序。
- Writing script — 某種語言所使用的字符集(拉丁字母、阿拉伯字母、漢字等)。
- Zipf's law —— 觀察發現,少數詞彙佔據了絕大部分的使用量,而稀有詞彙構成的「長尾」則佔據了其餘部分。