Lingua Mundi: Building a Language-Agnostic Map of Meaning from Open Lexical Data

One idea in every language, on one star.

A project history and technical account · 人工智能生成的初稿 · RHLS 工作室 · 2026年9月7日

RHLS 商店 · Lingua Mundi · 博客 · 英语音频 · English · Español · Français · Deutsch · Italiano · Português · 日本語 · 한국어 · 简体中文 · 繁體中文 · 廣東話 · हिन्दी · العربية


Notice — preliminary AI-generated draft. This document was drafted by an artificial-intelligence research agent (operating inside the RHLS "DeepSeek Harness" toolchain) at the direction of Raciel Hernández Hernández, the project's author. It is not the final publication: the authoritative, human-authored paper is still in development by Mr. Hernández. Every fact, figure, and quotation in this draft traces to a dated primary source (conversation logs with ChatGPT, Claude, and DeepSeek; project journals and session logs; the software repository and its documentation; and direct measurements of the live database and application programming interface), and the sources are listed in the appendix. Statements that could not be verified are explicitly marked. No claim in this draft should be treated as peer-reviewed or as final wording.

How to read this paper. 本书专为 not 计算语言学家和 not 程序员而写。 技术术语 首次出现时会以带点的下划线标注:将鼠标悬停(或点击)该术语可查看 通俗易懂的定义,或点击它跳转至完整的术语表 (附录 B)。 每处引用以及每个被提及的工具或数据源均附有链接, 可跳转至其原始来源或官方文档。仅想了解 故事主线的读者可阅读第1–3节和第10节;中间各节则详细记录了 相关工程实现过程。

Author and contribution statement. Lingua Mundi 由拉西埃尔·埃尔南德斯·埃尔南德斯构思、设计 并正在开发中,他是一位常驻墨西哥塔巴斯科州的独立研究员 兼翻译。该项目的开发是以 人为主导、与商业大型语言模型(OpenAI的 ChatGPT、Anthropic的Claude以及DeepSeek的聊天与推理模型—— 作者将其作为编程伙伴、审稿人和文档辅助工具。 本草稿本身是由人工智能代理在作者指导下撰写的,并 遵循该工作室的验证惯例:[H] 标记经 带日期来源、测量数据或代码验证的事实; [O] 标记的是已注明来源的 解释或观点;[NV] 标记的是无法 验证的陈述。根据工作室惯例,公开发布的文本采用工作室的语体,而非 作者的个人语体。

[H] Studio-voice rule (session log, 7 September 2026): "Studio/PR voice on all external/pitch copy — never Rex's personal voice." [H] Honesty rule: "No lies / no fake confidence" (studio conventions, September 2026).

Abstract

人类词典和词网的组织方式是by language:一个西班牙语词汇 文件、一个英语词汇文件、一个日语词汇文件。 但像“家猫”这样的词义 既不是西班牙语的,也不是英语的,更不是日语的——它是所有这些语言共有的,而每种 语言只是通过不同的表层形式来指代它:gatocatchatKatze。 Lingua Mundi(“世界语言”)是一个开放、免费且 与语言无关的词汇知识库,它试图颠覆传统的 组织方式:不再按语言分别编纂词典,而是将concepts (词义)存储一次,并将每种语言的词汇与这些共享的 词义关联起来,同时利用开放数据社区的多语言词网作为 对齐键。该项目由一人独立开发,仅使用一台 2014年左右的笔记本电脑(配备四核英特尔奔腾级处理器、8 GB 内存、 5400 rpm 硬盘,以及一条网速较慢的互联网连接——这台机器正是托管 实时系统的设备,其画面已为本论文直接截取;参见第 9.1 节),预算为零,仅使用 开放的词汇数据。 在2025年12月至2026年9月期间,该项目 从一个装有下载词典文件的文件夹,发展成为一个可运行的PostgreSQL 数据库,其中包含96,434 concepts1,238,383 word forms (lexemes)1,608,018 word senses171,672 semantic relations 涵盖六种活语言 (英语、西班牙语、法语、德语、葡萄牙语和日语), 一个 能在毫秒内返回结果的API查询系统,以及一个设计为“意义地图”风格的 网页界面——这是一张可探索的星图,其中一颗星可以同时代表cat · gato · 猫 · chat · Katze。 本文记录了该项目的理论 起源(即“意义而非拼写才是多语言数据的自然单位”这一直觉); 其设计所依据的 数学和语言学原理(一种语言无关的实体模型、基于语义集的概念对齐、 类型化关系的分类法、齐普夫定律排序,以及借鉴数据库实践中“烘焙,不要 重新推导”的物化视图模式); 所 采用的开放数据源及其许可协议;用于构建该项目的工具及人机协作工作流; 用户界面及其教学设计;以及 实施过程中发现的基础设施故障—— 包括一个无声截断错误,该错误曾短暂导致英语单词 cat 在自身概念中消失的静默截断漏洞(其修复链于2026年9月7日启动,并于2026年9月8日验证完成); 项目的当前状态;及其未来规划。 本文同时也隐含地展示了一个案例研究:一个有决心的人能够 利用开放数据、免费工具和借用的计算资源构建出什么——以及那些 使一个小型项目足够诚实、从而能够发展成大型项目的工程习惯(测量、标注日期、标注标签、承认未经验证的内容)。 Simplified Chinese (Mainland)

本摘要中的数据和统计数字系于2026年9月6日至7日测得; 具体查询内容、日期及来源详见附录A。

96,434概念 · 意义
1,238,383词形 · 词位
1,608,018词义
171,672语义关系
6运行中的语言
0.25 s默认星空 · 热态
AI 生成的初步草稿。 本文档由人工智能研究代理在项目作者 Raciel Hernández 的指导下起草。它不是最终发表稿——由作者本人撰写的论文仍在编写中——且未经同行评审。每一个事实与数字都可追溯到附录中所列的带日期的一手来源;未经验证的陈述均被明确标注。未经作者许可请勿引用。

1 · The intuition: why dictionaries are the wrong shape

One concept, six languages: the domestic-cat synset 02121620-n 02121620-n domestic cat EnglishcatgrimalkinhousecatmouserpussSpanishgatoFrenchchatchatteGermanKatzeKaterPortuguesegatobichanoJapaneseネコ
One concept, six languages — members of the domestic-cat synset princeton-wordnet:02121620-n (verified subset, September 2026).

每个语言学习者都曾体会过这种不协调感。你在 英西词典里查“cat”,却查到“gato”;你在 西日词典里查“gato”,却查到“”。 翻阅了三本词典之后,你 花了一个下午的时间,证实了你早先的猜测:同一个概念——一种 会发出呼噜声的小型家养食肉动物——竟然被 三个不同的组织分别在三个独立的文件中描述了三次,使用了三个不同的 标识符,而且这三个条目之间从未建立过任何关联。

Lingua Mundi背后的直觉是,这种形式对于 语言数据来说是不合适的。意义只存在一次。 而词汇则存在于许多地方。一个 将 meanings 作为第一类对象存储,并将 words 视为 不同语言赋予这些语义的标签的数据库,将使一个人 (或程序)通过一张单一的 共享映射在任意两种语言之间自由转换——并让学习者一眼就能看出,cat、gato、 chat、Katze, and 并非需要死记硬背的五个事实,而是一个事实披上了 五件外衣。

这一直觉并非如晴天霹雳般突然降临。它是在大约一年的时间里, 从某人的日常工作中逐渐萌发的——而关于它的最早文献记录 却异常朴素。

1.1 The first message

3 December 2025 上,作者与 ChatGPT 展开了一段对话,并 输入了以下内容(原文照录;该对话持续了四 个半月,最后一次编辑时间为 2026 年 4 月 21 日)[H]

"I want to find free dictionaries similar to JMDICT and Kanjidict2 for the following languages: Spanish, English, French, Italian, Portuguese, Chinese, Korean and Vietnamese. My intent is to create a unified multilingual database for various purposes. I'm also interested in knowing if similar databases exist for indigenous Mexican languages that I can freely access."

(会话日志,ChatGPT,对话“免费多语言词典”, 2025年12月3日;源文件见附录A。)

那条简短信息中的三点内容,预示了该项目后来 的发展全貌。首先,文中提到的语言——西班牙语、英语、法语、意大利语、 葡萄牙语,以及后来加入的日语——正是作者 作为翻译和语言教师所掌握并使用的语言(这套语言组合他 后来将其正式命名为“Core 6”),此外还有中文、韩语和越南语, 这些是他计划接下来要添加的。 其次,“unified多语言 数据库”这一短语已经指明了目标:不是六部词典,而是一部 将它们全部整合在一起的数据库。 第三,作者从最初的那一天起就在思考 indigenous Mexican languages——这一思路 反复出现(2026年8月[H]期间曾探索过 将玛雅语整合到Lingua Mundi中,且玛雅语资源 贯穿于他的研究笔记之中)。

这条消息背后的背景也很重要。 作者并非 受过专业训练的计算机科学家。他是一名翻译和语言辅导老师,当时 也在认真学习日语,并开发了一些小工具来让学习 过程更轻松:汉字和假名学习游戏,以及一个日语词典 处理流程(后来在2026年,一个用于日语电子书的注音编辑器也加入了这个工具箱 ——该项目后来演变为Shikibu应用)。他2025年末的 主目录记录了这段学习历程的“考古痕迹”:一份在11 November 2025上下载的KANJIDIC2汉字 词典文件副本、一份2025年12月的常用汉字列表 ,以及——受12月3日那次对话的启发——在5 December[H]上下载的 Open Multilingual Wordnet数据 (文件时间戳,/home/rex/;参见附录A)。 换言之,12月3日的 ChatGPT对话正是转折点:正是从“我需要日语 数据来支持我的工具”这一想法,扩展为“我想构建一个统一的多语言 数据库,免费提供,涵盖多种语言,包括我本国的 语言”的转折时刻。

1.2 From dictionaries to meanings: the December 2025 pipeline

作者接下来的行动可从他创建的文件中看出。在 2025年12月5日至12月16日期间,他以ChatGPT作为编程 伙伴,编写了一组名为Python的小型脚本管道——extract_omw.pymerge_dicts.pyunified_dictionary_pipeline.pycrossref_deterministic.py——该管道将来自多个开源渠道的词汇 数据下载、解析并合并,逐步形成结构日益完善的 [H](脚本及日期见于 /home/rex/)。 这一时期最重要的设计决策 记录在文件本身中:该流程的最后 阶段(日期为12月16日)将每个条目拆分为four kinds of objects—— conceptsenselexemegrapheme(其中“图素”指书面 字符,如汉字)——并将它们作为 JSON Lines 文档写入磁盘。 该模式颇具深意:sense 代表特定词典中某个特定词的特定含义concept 则是 多种语言中多个词义共同指向的共享概念;而 某个词义的concept_id字段允许为empty——意即“该词 义尚未与共同概念建立关联”。 该代码中的 作者注释将该方法描述为“零启发式”:不进行模糊推测,不 使用统计相似性技巧来判定两个词是否同义; 仅采用明确且有文档记录的关联。 [H](管道代码和注释, /home/rex/,2025年12月;详情见附录A。)

那个12月16日的架构,在微观层面,正是后来被称为Lingua Mundi的 整个项目的蓝图:词汇存在于语言之中; 意义存在于共享的空间之中;而那个艰难而真实的问题——哪种语言中的 哪个词代表哪个概念——绝不会被伪造。 尚未 与某个概念建立关联的词义会被保存在数据库中,其未关联状态清晰可见, 而非被默默地推测填补。 十个月后,当导入管道中的一个 错误导致英语单词cat与其概念之间失去关联时, 作者正是用以下措辞来描述这一原则:与其隐藏一个 “孤儿”,不如将其展示出来([H];参见第7节)。

1.3 The gap, and the widening

随后,相关记录在约五个月的时间里陷入沉寂——从 2025年12月中旬到2026年5月下旬,现有日志中没有 词典管道相关的工作记录[NV]。 对于一位需要指导学生 的在职翻译来说,这并不罕见,但值得明确指出的是:该 项目的进展是not持续的。它以爆发式的方式推进,其间穿插着 数周或数月其他工作的间隔——这种节奏将贯穿 整个2026年。

当该讨论线程重新展开时,其目标范围已进一步扩大。 在 1 May 2026 上, 作者正在研究“OMW v2.0 数据覆盖范围”(即 Open Multilingual Wordnet 版本)[H](对话标题及内容,ChatGPT,2026-05-01)。在 27 May 2026中,他发起了一段题为“开源语言 资源”,实际上是在寻求一份系统性的清单,涵盖所有可为多语言知识 库提供数据的免费词汇、 语法和语义资源 [H](ChatGPT,2026-05-27)。 至此,该项目已有了名称和 雏形;关于这两方面的证据将在下一章中呈现。

1.4 Why this matters beyond one person's project

读者可能会疑惑,为什么一篇论文要如此详尽地记录一个个人项目的 直觉。答案在于,这种直觉本身就是 该论文的贡献。 “meanings”(而非拼写形式)才是多语言数据的自然 单位这一观点,在学术界有着悠久的渊源(这是机器翻译中“中间语” 传统最古老的梦想,也是Princeton WordNet词义集的组织 原则; 参见第2节),但鲜有 个人在没有预算的情况下将其作为公共产品付诸实践。大多数 遵循这一原则的多语言资源——如开放多语言 词网(Open Multilingual Wordnet)、BabelNet、Universal Dependencies项目——均由 获得资助的大学联盟维护。 Lingua Mundi是某位 独立研究者的一次尝试,他仅使用开放数据和免费工具,亲自构建了 该基础设施的一部分,用于自己的翻译和教学 工作,并将其无偿分享。 这一尝试是否成功, 读者可依据本文其余部分的证据自行判断——而 作者本人的日记也表明,他一直以来都在以同样的 诚实态度提出同样的问题(参见第4.3节)。

2 · Background: what "a map of meaning" means

要理解Lingua Mundi试图构建的是什么,以及它真正新颖之处 何在,有三个方面的先期研究成果至关重要:语言学中认为 意义可以与拼写分离的观点; 计算领域的观点,即这种 语义可以作为数据存储,并在不同语言间建立关联;以及现代 研究观察到的现象:结构化的语义映射与神经语言模型是相辅相成的——而非 相互竞争的。

2.1 The sign and its two faces

现代语言学源于一个看似简单实则深奥的观察,通常 被归功于费迪南·德·索绪尔二十世纪初的讲座:一个词 是由一个sound/shape(“能指”)和一个concept( “所指”) (de Saussure, 1916/1983)的组合。根据这一观点,两种语言并非 两组碰巧可以互译的词汇;而是两组signifiers, 它们在共享的signifieds空间上部分重叠。 英语 能指 cat 和西班牙语能指 gato 虽然形式不同,但 所指相同。 如果机器能够将所指存储一次,并为其 附加能指,那么翻译就变成了通过一个共享的 中间层进行查找——这一理念在机器翻译中被称为interlingua 方法:不是直接进行英语→西班牙语的翻译,而是进行 英语→意义→西班牙语的翻译。

在机器翻译研究领域,通用语的构想由来已久, 但一再被证明在完全普适的情况下难以实现 (语言并不会将 意义切割成完全相同的片段,而且每位翻译者都知道,动物“cat”和 爵士乐手“cat”是同一 能指所承载的不同所指)。 但这个梦想从未消逝;它只是被缩小为一种 可构建的形式:词汇表——语言中能最好地映射到稳定、 共享意义的部分。

2.2 WordNet and the synset

The decisive narrowing came from psychology and lexicography. In the 1980s and 1990s, George Miller and colleagues at Princeton built WordNet, a lexical database for English organized not alphabetically but semantically (Miller, 1995; Fellbaum, 1998). WordNet's core invention is the synset (a contraction of "synonym set"): a group of words that can stand for the same meaning in some context. The synset {cat, true cat, Felis catus, domestic cat} is one meaning; the synset {cat, kat, guy, hombre} — meaning "an informal term for a youth or man" — is another, quite different meaning that happens to share the signifier cat. WordNet also records relations between synsets — most importantly the is-a hierarchy (hypernymy: a domestic cat is an feline, a feline is an carnivore, a carnivore is an* mammal…) — turning the dictionary into a graph, with meanings as nodes and typed relationships as edges.

WordNet 对 Lingua Mundi 之所以重要,有三个原因。首先,它证明了按 语义组织、可由机器读取的词汇表是可行的且极具 实用价值——现代搜索引擎、拼写检查器和自然语言 库至今仍依赖于它。 其次,它为世界提供了一个用于表示语义的稳定标识符 系统:Princeton WordNet 对其同义词集进行编号,因此 02121620-n 明确表示“家猫”,并在各个 数据库中均可被引用。 第三,它成为了一个多语言项目的基石: Open Multilingual Wordnet (OMW)

2.3 The Open Multilingual Wordnet: one meaning, many languages

由弗朗西斯·邦德(Francis Bond)和瑞安·福斯特(Ryan Foster,呼号 Bond & Foster, 2013)发起的 OMW 项目, 收集了多种语言构建的词网,并将其与普林斯顿 英语词网进行对齐:每种参与语言的同义词集都包含指向 其对应英语同义词集的链接。 由此产生的资源使得 Lingua Mundi成为可能:这是一组由人工精心整理的明确陈述, 其形式为“西班牙语gato(第1个词义)与英语 domestic-cat同义词集02121620-n具有相同的含义。” 当 Lingua Mundi 的作者在 2026 年 7 月的工程规范中写道,该项目将“以语义集为中心” 并通过 OMW [H] 实现语言对齐(规范文档, 2026年7月24日)来实现语言对齐时,他正是站在邦德和福斯特的肩膀上——正如他 2025年12月的管道脚本(该脚本直接解析了OMW的数据文件) 所做的那样。

2.4 The open-data ecosystem around the wordnets

OMW 是庞大且采用开放许可的生态系统中的一个节点,个人 可以在法律和技术上将其整合:

  • Wiktionary — 由维基媒体基金会托管的协作式词典

Foundation — 涵盖数百种语言的极其广泛的词汇, 包括定义、翻译、词形变化和发音,在 共享许可(Wikimedia Foundation;另见 Meyer & Gurevych, [2012, 对其作为专家词典竞争对手的价值评价)。

  • Wikidata——维基媒体的结构化知识库——用于存储陈述

带有机器可读标识符,并根据 CC0 协议发布(公共 域名) (Vrandečić & Krötzsch, 2014)。

包含一百多种语言的、带有句法标注的句子语树库 采用开放许可的编程语言(Nivre et al., 2020)。UD 贡献了 真实句子和词性信息——这些是词语如何被使用的证据 实际使用。

由吉姆·布林(Jim Breen)的 EDRDG 项目维护,涵盖日语 广泛发行,并被翻译成多种语言(Breen, 2004)。 这些是作者的起点(他创建的第一个词典文件, 于2025年11月下载的文件名为KANJIDIC2 [H])。

  • UniMorph — 一个多语言的屈折形态学语料库(词

(如按语法特征排列的 run/ran/running 等形式) (Kirov et al., 2018McCarthy et al., 2020)。

  • OPUS — 一组从……中提取的大量并列(翻译)句子

来自网络和电影字幕,采用开放许可(Tiedemann, 2012)。

根据单词在真实语料库中的出现频率进行排序。

  • The ISO 639-3 standard,该系统为每种人类语言分配一个稳定的

三位字母代码(例如:spa 代表西班牙语,jpn 代表日语),保持不变 作者:SIL International —— Lingua Mundi 该数据库将这些代码用作其 language 表的键 [H]

该生态系统的两个特性值得特别强调,因为它们构成了 整个项目的框架。 首先,这些许可协议是真正开放的——无论是宽松许可还是 共享相同许可——因此,只要 遵守署名和许可条款,将其整合到衍生数据库中就是合法的(Lingua Mundi在其自身的source表中记录了 每个导入数据集的来源 和许可信息;参见第 6节)。 其次,该生态系统是 complementary:Wiktionary 范围广泛但 深度有限;词网(Wordnets)深度深但范围窄;UD 关注词汇用法;UniMorph 则 关注词形;频率列表则关注词汇的突出程度。 Lingua Mundi的 工程难题并非“查找数据”——而是“合并那些原本 从未设计用于合并的数据,同时不歪曲连接关系”。

2.5 Why a map of meaning still matters in the age of large models

必须明确提出一个合理的质疑:如果大型语言模型已经能够 进行翻译、定义和对词汇进行推理,那么还有什么必要 构建结构化词汇表呢? Lingua Mundi作者在2026年6月的研究 论文(第3节)中提出了这一问题的答案,并在整个夏季对其进行了完善,该答案包含三个部分。 首先, verifiability:结构化数据库能够展示其工作过程——每个链接都有 来源、许可协议和日期——而模型的知识则是一种不透明的 统计混合体,无法进行审计、更正或引用。 其次, cost and access:查询本地数据库无需成本且可 离线进行,而每次模型查询都会消耗能源、金钱或两者兼有;作者的 既定设计原则是“零令牌研究查询”——本地 API is 研究界面 [H](项目备忘录,2026年8月29日)。第三, complementarity:2026年6月的论文提出——作为一种假设,且 对三个模型的审计结果均指向同一结论——一种基于概念标识符而非原始令牌运行的紧凑型模型 之所以能高效得多,恰恰是因为概念图在 网络之外 (参见第3节)。无论该假说能否经受 实验检验,概念图本身对模型仍具有实用价值:作为一种外部 存储,无需重新训练即可对其进行查询、更新和引用。

因此,Lingua Mundi 的思想渊源可以用一句话来概括: 句话概括:这是“国际语”的梦想,经由 WordNet 浓缩为词汇体系, 由 OMW 赋予多语言特性,通过开放数据运动获得合法性,并因 一位译者对词典的需求而变得具有个人色彩——该词典以意义而非 语言作为分类对象。

3 · The name, the thesis, and the seven-graph architecture (May–June 2026)

3.1 Naming

到2026年5月下旬,作者的笔记和规范中使用的暂定名称是 “多语言词汇平台” [H](Markdown规范主文件日期为 2026年5月23日,位于 /home/rex/Descargas/Phone backup/Download/)。名称Lingua Mundi——拉丁语中意为“世界语言”——首次出现在关于1 June 2026的现有 记录中,作为一份研究手稿的标题(参见 下文)[H](对话日志,2026年6月1日; 作者档案中最早经核实的 出现记录)。这一名称恰如其分:该项目的核心主张并非 其包含众多语言,而是它正是about the one space of meaning 这些语言所共有的基础。

3.2 A research thesis: meaning, not tokens

大约在2026年3月至6月期间,作者通过与 ChatGPT、Claude和DeepSeek的对话,提出了一项研究论点,探讨为何 语言的概念级映射能够使语言技术在效率和可及性方面 实现革命性的提升。 该论点基于作者 在对话中提出的初步框架(原文摘自其2026年7月18日的可行性请求, 其中他粘贴了该描述供审核),[H]

"Create a multilingual, open, machine-readable map of human language that separates: 1. Meaning · 2. Form · 3. Structure · 4. History · 5. Usage — into interoperable graphs. The long-term objective is to make language computable at the concept level rather than the token level. […] Modern NLP largely models: token → token. Lingua Mundi models: concept ↔ language."

6月手稿中阐述的核心论点是:语言 模型将其大部分处理能力都耗费在surface variation上——将“dog”、 “perro”和“犬”视为三个互不相关的事物,而实际上它们是同一事物以三种 形式呈现的[H](手稿V4,全文引自2026年6月1日的 审核对话)。 如果模型能够改用concept sequences模式进行读写—— 即由概念图在网络之外完成多语言处理工作——那么 该模型将更小、更经济,且可在普通计算机上运行。

3.3 Seven versions in one morning: the adversarial-collaboration method

该论文题为《Lingua Mundi:一种基于 概念的语言模型语义基础设施》,提出了seven-layer架构: 一个概念图(语言无关的语义,目标规模为10亿 节点),一个词义集图(将每种语言的词汇映射到概念上),以及 分别用于形态学、派生、词源、跨语言 对应关系和语用学的图——所有这些均通过一个通用的标识符系统连接;此外还有 一个概念锚定模型架构(一种Mamba风格的序列模型,读取 概念标识符)、用于概念 图的双曲(庞加莱球)嵌入、对事实的显式图检索,以及一份经审核的资源预算,表明 整个系统可在普通笔记本电脑上运行 [H](论文,2026年6月1日)。

这一事件之所以作为method而引人注目——且记录得格外详尽—— 是因为作者并非独自完成该手稿。在 1 June 2026当天上午,他仅用不到半小时就对草稿进行了七轮连续修订 (V1–V7),耗时不到半小时,过程中采用两种模型进行对抗性协作: DeepSeek负责起草每版修订稿,而ChatGPT则以 敌对同行评审员[H]**般的严谨态度对每份草稿进行审核(对话日志、DeepSeek “Lingua Mundi项目修订与校对”及ChatGPT“审核 反馈Lingua Mundi”,均于2026年6月1日)。审核记录 被逐字保留,并异常坦率地说明了每一轮修订所解决的问题:

  • 更正了 INT8 嵌入存储的算术运算(存在一个因子偏差——

(存储预算中的二进制误差);

  • 一条捏造的经验性论断(“从经验上看,我们发现……”)被删除了,并且

替换为基于先前研究的、明确标注的假设;

  • 将“与一个假设的未来模型进行比较”替换为一个

与真实模型(DeepSeek-V3)的对比;

  • 摘要中关于性能的声明逐渐被缩小范围;
  • 那些缺乏依据的扩展性主张被重新归类为开放性研究问题;以及
  • V7将该手稿重新表述,将其从一个经验性论断转变为一个诚实的

立场文件——一份包含明确且可证伪的评估标准的研究议程 计划(词义消歧的鲁棒性、消减实验、基线)。

审计记录中保留的最终结论显示,该手稿的 vision 评分很高,而 empirical support 评分则始终较低——且 最后一次审计的最终建议直截了当,给出了 [H] 的评分:

"If I were advising the project, I would now pivot from paper-writing to implementation. The next valuable artifact is not V8. It is Lingua Mundi Prototype 0.1 … with: 100k–1M concepts, English only, concept tokenizer, concept reconstruction, TinyStories training run, direct comparison against token-Mamba. That experiment would answer the central question: does semantic compression preserve enough information to justify the bottleneck?"

作者采纳了这一建议。关于这一事件,有三个观察点对于 理解后续的一切至关重要。首先,idea 从来都不是 瓶颈——用作者自己的话来说,他的构想在审核中获得了 A− 的评级; 真正的瓶颈在于证据,而审核报告中七次都指出了这一点。 其次, 作者的工作方法——将多个AI模型作为对抗性 协作者,保留每一份草稿和每次审核结果,并更倾向于诚实的 评估而非自信的夸大其词——成为了该工作室的永久 标准,这也是本文中[H]/[O]/[NV]验证 规范(附录A)所采用的相同方法。 第三,那份六月手稿中的七层 架构在作者转向 实现阶段时并未消失:它成为了该项目的roadmap。 目前(2026年9月)存在的 Lingua Mundi实现了概念图、词义集图、 形态学导入、语料库层以及一个API; 派生、词源、 对应关系和用法层则是同一 计划中明确排期的阶段(第5–6节、10.3节)[H](项目路线图,2026年8月29日)。

4 · The platform takes shape (July–August 2026)

4.1 Feasibility: "can this be done with open-source components?"

18 July 2026 中,作者直截了当地询问 ChatGPT,该视觉系统 能否利用现有的免费组件构建,以及他需要什么 来开发它 [H](对话“Lingua Mundi 项目可行性”, 2026-07-18, 00:44 UTC — 即作者所在的中部时区 7月17日晚)。该对话——以及随后的几周——记录了 该项目从研究论文向工程项目的转型。 该项目采纳了 他为供审阅而粘贴到该对话中的正式使命声明(引用于 第3.2节),作者随即开始 构建实际代码:磁盘上存有日期为 2026年7月17日 [H](代码快照,2026年7月;参见附录A)。

4.2 The engineering specification (24 July 2026)

24 July 2026 项目中,作者将设计整合成一份 104 页的 工程规范,即《多语言词汇平台——工程 规范》(版本 2.0),副标题为“修订版且已准备投入生产” [H](PDF,/home/rex/,2026年7月24日;本文摘录了其中部分文本)。该 规范是该项目的“宪法”,其内容阐述了后来所构建的大部分 内容:

  • The synset-centric principle. 该文件指出,每个词法

对象最终必须关联到一个 synset(一种含义),并且该 该数据库是围绕语义而非拼写来组织的。它运行良好 例如单词bank,它必须是一种包含多个 不同的词义集(“河岸”、“金融机构”、“指望…… “某物”)——绝非一团毫无区别的含义 [H]

  • Language tiers. 该规范将语言划分为两个层次:

首发支持的语言——英语、西班牙语、法语、葡萄牙语、日语和 普通话(简体和繁体)——以及第二语言——意大利语, 韩语和越南语 [H]。(实际发货的套装在 该数据库在两个方面存在有趣的差异,这些差异在第10节中有详细说明:该 目前支持的六种语言是英语、西班牙语、法语、德语、葡萄牙语和日语—— 没有普通话和意大利语,有德语。替换后的内容是 在现存的[NV]记录中没有任何地方对此作出解释,这是一种坦率的承认, (一个尚未解决的来源问题。)

  • The data model. 该规范的第 5 章概述了该模式

从广义上讲,该仓库首个迁移中包含的模型是 一个由11张桌子组成的核心区域,与 2025年12月原型中的“四实体直觉”,现已形式化: 语言、词素、词义、概念(词义集)、关系、来源、 语义集合及其辅助表(参见第5节)。

  • A five-level alignment hierarchy. 因为自动和手动链接

由于词语与概念之间的对应关系在可靠性上存在差异,因此所提出的规范 基于来源明确标注的链接,将匹配置信度分为五个等级 (例如,OMW 映射)直至启发式猜测——其规则是每个 存储的链接带有其置信度。这是该方法的成熟形式, 2025年12月“零启发式”规则:不是no自动链接,而是 labeled, honest 连接 [H]

  • A phase roadmap with gates. 第0至第5阶段,每个阶段均设有退出标准,

从模式和ETL到API再到应用程序。

  • A risk register — 附有提出词源解释的自我批评附件

以及CJKV/Unihan层,并就日语与中文中的“假朋友”发出警告 (例如,日语中的“娘”意为“女儿”,而中文中则意为“母亲”;“手紙”意为“信”,而 “卫生纸”)[H]

该规范还确定了项目后续将简化的组件堆栈: FastAPI、PostgreSQL、一个搜索引擎(规范中称为Meilisearch)以及一个 Web前端(Next.js)。 值得注意的是,截至8月13日,作者本人已经 开始对这一架构提出质疑(第4.4节)。

4.3 The July journal: thinking about the semantic operating system

大约在同一时期,作者的私人日记 (knowledge project.txt,85 KB,本文已全文查阅;文件时间戳 为2026年7月18日,单次工作会话)记录了一条相关且更具个人色彩的 思路:他试图深入思考一个 “通用语义图”——一种表示意义的、独立于记号体系的方法, 该方法可同时适用于编程语言、音乐理论、化学以及 自然语言(他将其命名为USG的独立项目)[H](日记, 2026年7月)。 该日记中与《Lingua Mundi》最相关的段落(第2563– 2587行)是他对同时用三种语言呈现one semantic object 这一行为的思考——这与cat · gato · 猫的直觉相同, 后者作为思考接口而非语言的练习而写 [H]。值得注意的是,该期刊中作为待解释“语言”的示例 ,正是Lingua Mundi代码库中的LanguageCreate架构——这证明了 到7月中旬,这两条线索(研究愿景与实际代码) 在他脑海中早已交织在一起 [H]

4.4 August: from schema to running system

2026年8月,Lingua Mundi转变为system。现存日志显示了一系列 密集的决策,每一项都留下了痕迹:

  • 1–8 August. 作者探讨了图论与知识表示

选项(“JSON 图表版”,7月29日;API 变现方案,8月7日至12日) 并且——这对最终架构至关重要——询问了API是否 “确实需要”一个大型堆栈(第4.5节)[H]

  • 11 August. 他探讨了将 Maya languages 整合到 Lingua 中的可能性

Mundi(“Lingua Mundi 玛雅整合”),延续了对 墨西哥土著语言首次在2025年12月的[H]信息中被提及。

  • 13 August. 经过两次设计讨论,最终确定了该

产品:“Linguistic API 技术栈”(参见 4.5)和“语义交互” “Layer”,该概念勾勒出了知识层之间未来的交互界面 以及应用程序 [H]

  • 19–25 August. 他研制出了Japanese demonstration:一款紧凑型

离线数据库(SQLite)捆绑了日语词典数据,以便 面向概念的设计可以被触摸、查询并展示给他人 (“构建日语演示版”;生成的 lingua-mundi-jpn.sqlite 文件是 (保存在磁盘上)[H]。该冲刺有一个具体的截止日期,并且 受众:Japan Foundation的代表本应到他那里 下周去大学,还有那个演示(连同假名注音 (同期被重命名为 Shikibu 的编辑器)被制作为 此次访问的[H]产品资料(会谈记录、 2026年8月19日至25日)。

  • 23 August. 被要求用一段话描述这一概念时,他

收到了一份总结,内容与日志中显示他构建的内容一致:“a 适用于人类语言的机器可读语言基础设施……倒不如说 Lingua Mundi 不仅仅是一款日语词典或翻译应用,它还是一款 “旨在成为一个通用的语言智能层” [H] — 此外,在同一次对话中,一段名为“technical”的描述中提到了 当时计划的栈(PostgreSQL、Apache AGE 用于图查询、OpenSearch 以便检索,FastAPI(如 API)显示下个月的测量数据 将使 [H] 变得没有必要(第 4.5 节、第 6 节)。

  • 24 August onward. 该代码库已迁移至其永久位置,作为

包含每日 GitHub 备份快照的正式仓库(“LinguaMundi”) 8月27日开始的版本追踪 [H](代码库快照;参见附录A)。

4.5 The lean-stack decision that shaped everything

8月份最具影响力的技术决策被原封不动地保留了下来。在 13 August 2026 上,作者贴出了自己计划采用的技术栈—— FastAPI、PolarsDuckDB、PostgreSQL、Apache AGE(一种图扩展), OpenSearch、RedisCeleryReactDocker——并问道:“如果 语言学 API 已经运行在 PostgreSQL 上,它真的还需要这个技术栈吗?” [H](对话“语言学 API 技术栈”,2026年8月13日)。

他得到的——并采纳的——答案是,目前几乎都不需要这些: 仅凭 PostgreSQL 就能处理关系型词典数据、汉字、 读音、词形变化、翻译、全文检索,甚至图式 递归查询;正确的原则是“PostgreSQL受限→添加 技术”,而非“第三阶段要求图数据库→安装图数据库” [H](同一次对话)。该建议总结道:“你的API的竞争 优势不在于基础设施,而在于你基于数据构建的语言数据模型和 转换机制”[H]

这一决策——仅使用一个关系型数据库、一个 API 框架, 在实际需求明确之前不采用其他任何方案——正是第 6–7 节中所述 性能架构的直接前身。 当2026年9月, 数据库规模扩大到160万个词义,而简单查询的速度却降至 数分钟时,作者并没有转而采用图数据库或搜索引擎: 而是采用了PostgreSQL materialized views——即“预处理,不 重新推导”模式——并在2014年的硬件上将最慢的查询时间从超过一分钟缩短至 约一秒(第7节)。 8月份决定 保持系统精简,正是这一举措使得9月份的优化既必要又 可行。

4.6 The human-AI development method, in practice

阅读这部历史的读者会注意到,几乎每一个里程碑都 附有一段对话记录:作者的思维方式就是通过对话展开的。到2026年 8月,他的方法已趋于稳定,并形成了一种可以 根据记录准确描述的模式:

  1. The human sets the direction and owns the data. 中的每个请求

日志归作者所有;每个文件都存储在他的机器上;每一个决定—— 包括像“lean-stack”问题这样的反转——都是他的。

  1. 使用了 AI models are used as specialized collaborators. ChatGPT

广泛用于研究、建筑评论和审计;DeepSeek用于 起草和修订周期,以及(后来)作为支撑该系统的底层框架 工作室自有的自动化系统;Claude 用于长期记忆和项目管理 上下文(该工作室的知识库最初源自克劳德的记忆导出)。

  1. The record is kept. 对话已导出(作者的存档)

(包含数千个),代码会被快照保存,并且——从2026年8月26日起——每个 工作会话已记录在 Obsidian 知识库中,其中包含 前言、日期和审核状态(第9节)。本文是 这完全是因为那个记录习惯才得以实现。

  1. Adversarial review is built in. 6月稿件的V1–V7审核

循环(第 3.3 节)已成为一项惯例:草案由一名 与编写这些内容的模型不同,且审计记录保存在 文件。

无论将其称为“氛围编码”、“AI辅助开发”,还是简单地 “使用工具”,为了留存记录,如实标注至关重要: Lingua Mundi 是一个由人类主导、在与AI助手经过深思熟虑且有据可查的合作中 构建的项目,而本文(根据前言说明,其本身是在 作者指导下由AI生成的草稿)正是采用同一 方法产生的成果。

5 · Design: the linguistic and mathematical principles of the model

本节用通俗易懂的语言解释了决定 Lingua Mundi 如何存储语言的基本原理。想要了解 history 的读者可跳至第 6 节; 想要了解 formulas and schema 的读者则可在本节及 附录 A 中找到相关内容。

5.1 Four kinds of objects, one space of meanings

该数据模型直接源自2025年12月数据流中的四个 实体类型(第1.2节)以及2026年7月规范中的十一张 表[H]。 在其成熟形态下,该数据模型存储五类核心对象 (已根据2026年9月[H]的实时架构进行验证):

  • Language — 每种人类语言占一行,以 ISO 639-3 代码为键

三字母代码(engspajpn、……),及其名称、自称(该 (使用者所用的名称)、语系和书写系统。添加一个 按设计,将语言添加到整个系统中,需添加一行以及相关数据集: 没有任何按语言划分的表 [H](代码和项目注释, 2026年8月29日)。这种“语言无关”的特性属于模式层面的 “通用语”理念的体现(第2.1节)。

  • Lexeme —— 某种特定语言中的词形:字符串 cat,该

字符串 gato、字符串 。一个词素恰好属于一种语言 并具有词性。

  • Senseone meaning of one lexeme as recorded by one dictionary

WordNet 中“cat”指动物,而“cat”指爵士乐手,来自 WordNet,源自Wiktionary的“cat”一词,指“圣诞木柴”。一个词素通常具有 多种含义——这就是该模型对 polysemy 的表示方式(一个词, (多种含义),但绝不会将这些含义混为一谈。一种含义可能……也可能 可能尚未与某个概念建立关联;该关联由字段 concept_id 表示, 它是 nullable by design —— 保留了未关联的含义,并显示为 一个孤立项,而不是通过推测填入的 [H](模式;管道注释, 2025年12月)。

  • Concept——一种跨越语言的共同含义:这一概念

由 Princeton WordNet 语义集合 URI 标识的“家猫” princeton-wordnet:02121620-n [H](实时数据库)。概念位于 多语言对齐结果如下:西班牙语 gato(其含义之一), 英语版 cat、法语版 chat、德语版 Katze 和日语版 均可 都指向同一个概念——它们是“一颗星”,只是名字不同 (第8节)。概念表是该系统的核心,在 当前数据库包含 96,434 行 [H](测量数据,9 月 6 日至 7 日) 2026年)。

  • Relation — 两个概念之间的一种带类型的有向连接,

例如,家猫 IS_A 猫科动物,或猫科动物 IS_A 食肉动物。关系 包含一个谓词、一个置信度和一个来源。当前数据库中存储了 其中171,672个为[H](测量时间:2026年9月6日至7日)。

围绕这五个表,还配置了来源追踪机制——一张名为source的表,用于记录 每个数据集的来源、许可协议及其URL(以确保数据库中的 所有陈述均附有出处),连接至OMW 格式的语义集表,以及用于汉字和读音的辅助表[H] (模式, 2026年9月)。

5.2 The alignment problem, and why it is not faked

The central intellectual problem of a multilingual map of meaning is alignment: deciding that this sense of this word in this language is the same meaning as that sense of that word in that language. Lingua Mundi's answer, inherited from the OMW design, is to not decide it fresh: the OMW already states, per language, which of its synsets correspond to Princeton WordNet synsets, so the database imports those explicit mappings as its primary alignment layer [H] (Bond & Foster, 2013; import code). Where no explicit mapping exists, the system applies its five-level confidence hierarchy (from the July 2026 specification): explicit source-stated links rank highest; inferred links rank lowest and are stored with their level — never silently promoted to "fact" [H] (specification, 24 July 2026). This is the mature form of the December rule the author scribbled in his pipeline code: "zero heuristics." It is not that the system never guesses; it is that guesses are labeled as guesses, which is what makes the database honest enough to grow: a wrong guess that is marked as a guess can be found and fixed; a wrong guess stored as fact poisons everything downstream.

同样的原则也适用于语言的细分程度。ISO 639-3 区分的是真正的语言,而非政治边界或书写系统 的变体。作者指出了一个未来可能出现的真正棘手的情况: 韩语,其唯一的 ISO 代码 kor 同时涵盖了大韩民国 的标准和朝鲜民主主义人民共和国的标准。现存 记录显示,这已被标记为待定建模决策 [H] (会议记录,2026年9月7日)——这既体现了该模式“ 存储languages而非区域设置”的原则,也提醒我们:现实世界的语言 数据难以被简单地归入“每种语言一行”的框架之中。

5.3 The graph: taxonomies, neighborhoods, and the long tail

一旦感官与概念对齐,且关系将概念连接起来, 数据库is便形成了一个图:96,434个语义节点通过171,672条带类型的边相互连接, 其中最大的子图是继承自WordNet的is-a分类法 (哺乳动物 → 食肉动物 → 猫科动物 → 家猫),并通过“属于”、“ 是……的一部分”以及跨语言关系 [H](测量,2026年9月; 模式)得到了丰富。关于此类图的三个数学事实塑造了用户 界面和工程设计:

  1. Taxonomies are trees of meaning. 因为每个概念的父类都是

如前所述,该系统可以回答“这是什么类型的?”(爬上去)以及 “这有哪些种类?”(往下爬)——其背后的操作是 接口的分类学视角(第8节)。

  1. Degree distributions are Zipfian. 真正的语言图是

scale-free-ish:一些概念(如“动物”、“人”、“事物”)有 巨大的邻域,而大多数概念只有寥寥几个邻居。 这种“长尾”与Zipf在……中测得的著名统计分布形状相同。 词频(Zipf, 1949):少数词汇占了绝大多数 用法。由此衍生出两个设计上的结果:必须存在排序(你不能 (显示一个查询的 30,000 个释义),且排序必须为 meaningful — 因此,该界面根据概念的sky brightness值对其进行排序,一个 用以衡量某个语义的“重要性”或关联程度(第5.5节)。

  1. Shortest paths are the natural translation route. 给定两个概念,

可以在图中搜索连通路径——该操作背后的原理是 该界面的六分仪工具(第 8.4 节),实现为一个有界 在分类法上进行双向广度优先搜索(≤ 10 跳, 每个节点25个邻居,响应时间以毫秒计) [H] (代码,在线 测量,2026年9月)。

5.4 Zipf and the shape of dictionaries

Schematic Zipfian long tail: the head is baked, the tail stays relationalthe headfew words, most usage —baked into ranking viewsthe long tailrare words stay in therelational tablesschematic — Zipf's law: frequency ∝ 1/rank (Zipf, 1949)
Schematic only — it illustrates the design consequence of Zipf's law described in Section 5.4.

Zipf定律值得特别提及,因为它悄然阐释了 整个性能架构。如果词频遵循幂律,那么 任何词典都由一小部分高频词和 数量惊人的低频词长尾构成。 2026年6月的论文手稿甚至推导出了 基于Zipf的概念词汇表[H]的覆盖率计算方法 (手稿V7审核版,2026年6月1日)。 对于数据库而言,长尾现象意味着: 大多数 rows 属于罕见词,大多数 queries 命中常见词,而任何必须 扫描整个表(包括所有罕见词)的查询,其速度都 会比能够基于预先计算的 排序结果开始的查询慢得惊人。 第7节中的“物化视图”模式,归根结底是一种 将Zipf定律从性能敌人转化为设计工具的方法:将 head(即排序结果,即每个概念的前几项词汇)一次,并让 tail 保留在关系表中,以供真正需要它的罕见查询使用。

5.5 Sky brightness: one ranking to rule the map

该界面的组织隐喻是 star map(第 8 节),且 该隐喻由实际计算支撑。 每个概念都被分配了一个 brightness——一个用于对“天空”进行排序的数值量度——它源自该概念 在多语言图谱中的地位:有多少种语言与之关联的词汇, 这些词汇集的丰富程度如何,以及该概念在 分类法中的突出程度。 数据库将其具体化为 concept_sky_rank,即 对所有 96,000 多个概念的预计算排序,因此“给我整个天空” 在请求时无需对百万行数据进行排序 [H](脚本与 度量,2026年9月6日)。两个配套视图——concept_lang_rank (按语言排名)和 concept_word_rank(每个 概念在每种语言中的前四个词,经过“预处理”处理,使得为一颗星添加其相关词汇只需 进行查找,而非对160万个词义进行连接)——共同构成了排名系统 [H](脚本,2026年9月6日;行数见附录A)。

5.6 Bounded work: the game-designer's discipline applied to a database

最后一个设计原则借鉴自电子游戏。无论游戏世界有多大,游戏都会在 16 毫秒内渲染一帧画面:它对每帧的工作量 进行了预算分配。Lingua Mundi 采用了同样的原则——在无限数据空间上, 每个查询的工作量都有上限——因为其硬件有此要求 (一台 2014 年的笔记本电脑;第 9 节)。任何请求都不得扫描整个语料库;每个 请求都必须从索引或预计算视图开始;界面仅在用户进行操作时才 渲染(CPU 空闲率 ≈ 0%);结果采用 稳定的窗口进行分页。 第 6 节和第 7 节展示了这一 原则遭遇的三个性能瓶颈,以及如何通过相同的模式解决每个瓶颈:预计算,不要 重新推导。

6 · Architecture: importing the world, serving the map

6.1 The pipeline: one registry, twenty-plus importers

每个数据集都是通过 importer 进入 Lingua Mundi 的——这是一个 能够读取某种外部格式并将其写入规范模式的程序。 唯一的权威导入程序列表存储在一个文件中,即导入程序 注册表;截至2026年9月,其中已包含二十多个注册插件, 涵盖: Princeton WordNet和英文版WordNet、Open Multilingual Wordnet (OMW)、Wiktionary及其机器可读衍生格式kaikki、Wikidata、 UniMorph和J-UniMorph(形态学)、Universal Dependencies树库(UD)、 OpenThesaurus(德语同义词)、CMU发音 词典,、IDS character decompositionsCLICS跨语言数据、 词频表以及日语语族——JMdict、 EJDict、KANJIDIC2 [H](导入程序注册表和项目说明,访问时间 2026年9月6日至7日)。 (关于准确性的一点说明:导入商目录中确实存在一个用于 OPUS 平行 语料库的文件夹,但这是一个空的、未注册的 占位符,正在等待路线图中的句子层——此处列出仅为如实说明, 并非作为已发布的源 [H] (代码清单,2026年9月6日至7日)。) 每个导入器均根据 相同的ISO代码注册其目标语言,这使得该模式在 实践中(而不仅仅是理论上)保持了语言无关性 [H](代码)。

导入操作由一条管道进行监管,该管道会运行每个数据源、记录 导入任务,并——这对第7节至关重要——报告是否成功。 每次 导入完成后,它都会刷新排名视图(第5.5节),以便“天空”始终 反映最新数据 [H](脚本,2026年9月)。

6.2 The corpus today (measured)

Lexemes per live language (rounded, September 2026 audit)Japanese · jpn345k lexemesEnglish · eng271k lexemesGerman · deu176k lexemesSpanish · spa152k lexemesFrench · fra149k lexemesPortuguese · por145k lexemeslexemes in thousands (enrichment audit, rounded — Section 6.2)
Lexemes per live language (enrichment audit, 6 September 2026; rounded). Full SQL counts in Section 6.2.

2026年9月6日23:02(中部时间)对在线数据库进行的SQL直接测量, 于2026年9月7日重新核验(两次计数结果一致)[H]

TableRows
concepts (meanings)96,434
lexemes (word forms)1,238,383
senses (word-dictionary meanings)1,608,018
relations (typed concept links)171,672
languages (live)6 — eng, spa, fra, deu, por, jpn

各语言的词汇权重(词汇丰富度审核,2026年9月6日 [H]):

LanguageLexemesSenses
Japanese (jpn)≈ 345,000≈ 528,000
English (eng)≈ 271,000≈ 393,000
German (deu)≈ 176,000≈ 203,000
Spanish (spa)≈ 152,000≈ 167,000
French (fra)≈ 149,000≈ 157,000
Portuguese (por)≈ 145,000≈ 160,000

针对这些数据,有两点需要如实说明。首先,各语言的数据 均为近似值(根据审计结果四舍五入);而表格层面的 SQL 计数 在测量瞬间是精确的。其次,语料库为 layered: 部分 数据集(所有 Wiktionary 及词频列表)在每次导入运行中被有意 限制为 50,000 行,更全面的覆盖范围由其他 来源提供,且该上限已明确记录而非隐蔽的 [H](审计报告,2026 年 9 2026年9月6日)。第7节展示了当类似的上限被not 记录为风险时会发生什么情况。

6.3 The API surface

该系统公开了一个小型且被刻意冻结的 HTTP API(FastAPI)接口,其 Phase-0 攻击面据文档记载,即使新阶段推出,该接口也永远不会发生故障 [H](项目备注,2026年8月29日)。这些端点已于 2026年9月 [H] 经实测验证:

  • /languages — 列出现存语言及其元数据;
  • /lexemes/concepts — 分页列表查询(limit/offset,capped

(此前在8月至9月进行的审计中发现这些文件未装订,因此每页定价1,000);

  • /analyze —— 某个词的形态/词汇分析;
  • /kanji/lookup —— 日语汉字及词典查询;
  • /graph/sky —— 星图数据源:按天体亮度排序的概念图,其中

搜索参数(querylang)、深度(skip/层)、是否 附加成员词(words)和一个taxonomy lensanchorlens=up|down)从给定的位置沿is-a树向上或向下爬行 概念;

  • /graph/star/{id} — 一颗完整的星:每种语言中的成员词数量以及

其相邻的概念,两者均采用分页;

  • /graph/path —— 两个点之间的有界图搜索(第 5.3 节)

概念;

  • /graph/word ——“词汇透镜”:给定一个词和一种语言,其中的概念

其感官目前连接到。

所有响应均经过压缩(gzip),且每个查询都设计为从 索引或物化视图中执行——这符合第5.6节 [H](代码和实时头文件,2026年9月)中的“有限工作”规则。

6.4 Why the design is language-agnostic in the database, not just on paper

读者现在可以看清整个循环了。一种新语言以一行 language 的形式出现(例如,普通话,代码 cmn),外加已注册的数据集(OMW 普通话 词网、UD 普通话树库)。 导入工具会写入该语言的词素、词义,以及—— 在存在 OMW 或其他显式映射的情况下——其词义→概念的关联。 排名视图重新计算;系统中新增一种语言;无需修改表结构; 无需迁移;API中也不存在特殊情况。计划沿此 确切路径开发的下一组语言——普通话、粤语、韩语和越南语——在 第10.3节中,其中将决定 其时间表的数据可用性勘测记录在[H]中(会话日志,2026年9月7日)。该 设计所承诺的——“无限添加语言”——因此并非营销噱头:这 是该模式的直接结果。

7 · Two infrastructure lessons: bake-don't-re-derive, and fail-loud

Query latency before and after the materialized-view patterndefault sky8.6s0.25ssky · 1,000 stars + words>60s1.1sper-request ranking0.5s0.02s
Query latency before and after the "bake, don't re-derive" materialized views (warm cache; 2014-era laptop).

每个数据库项目最终都会遇到性能瓶颈。Lingua Mundi 在一周内就遇到了三个这样的瓶颈——随后发现,最耐人寻味的问题 并非速度,而是“沉默”。本节将讲述这两个故事,因为 它们共同构成了该项目中最具普适性的工程经验教训。

7.1 The pattern: bake, don't re-derive

解决这三个性能瓶颈的规则非常简单,只需一句话就能概括: 当许多查询都需要进行相同的耗时计算时,只需计算 一次,存储结果,并保持其最新性——不要为每个 查询都重新计算。 用数据库术语来说,Lingua Mundi 使用了 PostgreSQL 物化视图: 这些预计算的表就像是装满答案的索引。

  • Wall 1 — ranking the sky. 最初是询问默认星图

迫使数据库对整个语料库进行重新排序 per request:关于 在该项目中那台2014年款的笔记本电脑上,每次耗时8.6秒。修复后,该问题已彻底解决。 分为 concept_sky_rankconcept_lang_rank(94,498 和 218,120 行预计算结果),随后默认天空给出了答案,内容为 ~0.25 秒,而更深层的请求仅需数十毫秒 [H](实测值, (2026年9月6日)。

  • Wall 2 — naming the stars. 仰望苍穹 with its words

附件(每种语言中每个概念的热门词汇)需要跨1.6进行关联 每次请求都会触发数百万个传感器;当星级为1,000时,该查询耗时超过 一分钟——一个病理案例。修复过程将这些词本身“固化”了: concept_word_rank 会预先计算每个概念下排名前四的词,每个 语言(创建时有 338,378 行),将一个耗时一分钟多的连接操作转变为一个 查找时间约为 1.1 秒,默认视图的加载时间约为 0.25 秒 [H](实测, (2026年9月6日)。

  • Wall 3 — hierarchy and pagination. 攀登和下行

分类法(镜头上下移动)以及在稳定的星群窗口中翻页浏览 通过规范谓词、索引排序和稳定分页来解决 Windows(DISTINCT ON 风格的查询)而非图数据库 —— 8月“精简仓位”决策(第4.5节)的收益 [H] (代码和测量数据,2026年9月6日)。

每次导入后,视图都会自动刷新,因此“预计算”绝不意味着 “过时” [H](脚本)。 整个模式是数据库领域中 对游戏开发者所称“预算优化”的实现:耗时的工作仅执行一次, 且不属于关键路径,而用户的请求始终只读取预先计算好的 结果。

7.2 The silent truncation that hid cat

2026年8月下旬,语料库的英语层被导入,当时设置的 行数上限其实完全不是大家原本预期的上限。负责监督导入的 脚本将英语Open Multilingual Wordnet的导入数量限制为50,000 候选项 — and then reported success [H](会话日志,2026年9月6日, 根本原因条目)。英语cat在 该文件的字母顺序中对应候选项number 52,195。它被截断了。 在117,659个英语同义词集中,大约有21,830个 从未被创建;对于这些含义,英语 词义虽然以原始词典条目的形式存在,但从未与概念建立关联。 单词 cat 并非从数据库中缺失——而是在映射中不可见:搜索其含义时无法找到它,因为其词义本应指向的含义节点 [H] 从未被构建(同 一来源)。

大约六天里,没人知道原因。作者关注的那个演示——cat · gato · 猫 在单星模式下——用西班牙语和日语都能正常运行,但在英语中却显示为空结果, 而这个空结果看起来像是一个数据缺口——仿佛英语中根本没有这个词。 (根据记录中的一则时间注释:多语言“天空”功能本身直到 直到integrate_core6.py在 8月至9月的导入周期临近尾声时完成了导入语言的链接——在此之前,备用“天空”仅为 一个单一语言的小视图——这就是为什么英语的缺口直到 9月初才浮出水面,即共享概念视图实际上线后 [H] (会话日志,2026年9月6日)。)作者本人在 会话日志中坚持认为, 这是"not a data gap — infrastructure" [H](会话日志, 2026年9月6日)。他是对的。 问题不在于数据,而在于 数据处理管道的“诚实性”:一次截断的导入报告了成功,而系统中 没有任何设计能察觉到,在50,000行限制下,这种“成功” 实际上意味着第52,195个候选记录的失败。

7.3 The fix: an uncapped, idempotent repair chain

此次修复——于2026年9月6日至7日设计并启动,并于2026年9月8日确认完成(参见第10.1节)——是修复数据 管道而不丢失数据或损害对[H]信任的典范(脚本和会话日志, 2026年9月6日至7日):

  1. Re-import the English WordNet without the cap — 具有幂等性,因此一个

中断的运行可以简单地重新启动,而不会重复行;

  1. 新创建的语义集的re-run the synset-to-synset relations
  2. integrate:将新语义集提升为概念,并链接其成员的词义

concept_id 字段,并重新表达概念关系;

  1. refresh the materialized views,因此地图反映了修复后的情况

语料库;以及

  1. verify end-to-end 附带一个验收脚本,该脚本通过

数据库,并通过实时的API,那个英语的cat到达了 家猫概念车 princeton-wordnet:02121620-n 及其 多语言成员——gatochatKatze——并且该 该概念具有分类学父类。接受性检查的设计目的是 可随时重新运行,并以响亮的“通过”或“失败”提示退出。

由于每个步骤都设计为幂等(get-or-create、 skip-if-exists),因此修复过程中机器崩溃只会造成时间上的损失: 该链可重新启动并完成任务。这一特性还能保护 生产数据库免受部分状态的影响。

7.4 The lesson: fail-loud vs. fail-silent

cat 事件是每个数据工程师都深感恐惧的一个问题的典型案例: a pipeline that fails silently and reports success. 其中所揭示的方法论 启示——即行数上限并非成功标准,且数据导入人员必须 验证数据的完整性,而不仅仅是确认导入完成——值得作为 开放数据基础设施的一条通用原则加以强调,因为在该领域,数据集的来源 无法得到保证,数据处理管道也需手动构建。 Lingua Mundi的应对措施 以两种形式制度化:任何未来 导入链均可运行的接收入脚本,以及该工作室的既定规则:未经验证的 声明应标记为“未经验证”——无论是在数据库中(孤立词义保持 可见,链接上标注置信度),还是在每份书面记录中 中( 本文采用的[H]/[O]/[NV]约定,见附录A)。 一个能够显示 其孤立条目的系统,其缺口是可以被发现的。一个隐藏这些缺口的 系统,其缺口终将被发现——最终,由最糟糕的 人发现:一个正在寻找cat的用户。

8 · The interface: a star map of meaning

数据本身并不是一种产品。塑造 Lingua Mundi 界面的核心问题很简单:what should looking at a map of meaning feel like? 作者在2026年9月第一周期间逐步形成的答案是: 它应该让人感觉仿佛在仰望星空——更确切地说,就像是 一幅虚构的宝藏星球图:一张可供探索的宇宙纸质地图 ,其中每一颗星辰代表一个想法,而语言则是你选择用来 观察它的望远镜 [H](会话日志,2026年9月1日至7日)。 本节 描述了由此产生的界面:其教学隐喻、其视觉 语言、其工具,以及使所有这些 都能在2014年款笔记本电脑上运行的工程技术。

8.1 From dictionary page to sky: naming the product

该界面在两周内经历了三次改版,其名称 反映了产品的演变历程:[H](会话日志,2026年8月31日–9月6日 )。它最初是一个普通的词典页面(“/gui/”,8月31日被称为 “观测站”),9月1日随着 数据导入完成并出现星空可视化效果,该界面更名为Planetarium;随后—— 作者审视结果后断言这些星星只是“脚手架,而非 产品” ——9月6日当晚,该项目转型为一个语义图 探索器:同一片星空,但如今the point代表了意义,其中的节点 是按你启用的语言标注的概念,边根据 关系类别进行着色,搜索功能则能消除语义歧义。 旧版星空视图被 保留但未与新功能关联;该探索器成为 Lingua Mundi [H] 的默认界面(会话日志,2026年9月6日)。

8.2 The pedagogical metaphor: an instrument, not a dashboard

界面的每个元素都与天文学以及语言项目本身中的某个概念 一一对应——这是一种刻意为之的教学设计 (隐喻表是该产品的内部文档) [H](会话日志,2026年9月6日至7日):

Star-map elementWhat it really is
A starA concept — one meaning, shared across languages
The stars' brightness (magnitude)A concept's lexical richness and connectedness (Section 5.5)
The language you look throughA telescope — the same sky seen in Spanish, English, Japanese…
Constellations and threadsFamilies of relations — the is-a taxonomy drawn as plotted course lines
Zooming inDescending from the wide sky to a single star and its neighborhood (the Hipparcos→Gaia idea — Gaia Collaboration et al. (2018): more detail the deeper you go)
The exposure dialDeepening the field — asking for more and dimmer stars around a focus
The sextantMeasuring a route between two meanings through the taxonomy
SkymarksBookmarks on stars
The word compassThe enabled languages, ringing the focused star as word chips
The course logYour exploration trail — how you arrived at this meaning

这一切都不是花哨的装饰;记录中引用了作者为该工具制定的设计纲要, 值得再次强调:界面应当是“一个真正的 探索工具,而不是玩具” ——一张学习者或 研究者能够真正探索的所有语言的地图——其来源应像一张 可导航的纸质地图,而非仪表盘 [H](会话日志,2026年9月 6日)。 本着同样的精神,仪表盘被刻意设计为 skeuomorphic:带黄铜旋钮的曝光表盘、六分仪测量、绘制好的 航线、纪元戳记——这是一种老式天文台的美学风格,旨在 通过触感而非菜单标签进行教学。

8.3 What is on screen

该探索者([H],已于2026年9月通过端到端验证)提供:

  • 输入 Search with sense disambiguation. 时,系统会返回 gato(西班牙语)

meaning-stars;每个结果都可以显示哪些语言中的哪些词语具有共同点 含义——这块关于家猫明星的展板展示了它的 多语言语义集成员,例如英语的 catgrimalkin、德语 Katze,日文名称为(第8.5节)。

  • Travel. 点击一颗星(或按住 Shift 键点击 / 按下小节键)以使

它成为焦点;天空以它为中心重新聚焦,其周边的景象随之显现。

  • The star panel. 该重点关注星团各语言的成员数量,其

定义及其邻域——对于较大的邻域,则采用分页显示。

  • The taxonomy lens. 攀登至一颗恒星的“父母”(“这是什么,是一种……

“是什么?”)或沿着……向其子项下探(“这有哪些种类?”) 规范的 is-a 族谓词。

  • The instruments(均为实时、已验证):exposure dial 扩大了

分步聚焦星场(90 → 180 → 360 → 720 → 1,000 颗星), 无需再次出行即可将更广阔的天空尽收眼底;sextant的尺寸为 两个星号之间的有界图路径(第节中的 /graph/path 搜索) 5.3),在天空中划出一条金色的虚线航线,并记录每段航程; skymarks 标星(已本地保存,因此您可以创建自己的迷你星座) (在重新加载后仍保留);word compass 用单词“word”环绕着聚焦的恒星 图标——每种已启用的语言对应一个,点击即可切换搜索语言 语言;以及 course log, home bearing, epoch stamp, and reticle 助你掌握方向 [H](会话日志,2026年9月7日)。

  • The support affordance. 点击“✦ 支持”按钮即可开启捐赠

模态(第10节)。

8.4 Engineering the sky on 2014 hardware

该界面的美观性必须服从一项严格限制:它必须能在 配备2014年款处理器、8 GB内存和机械硬盘的 机器上流畅运行——这台机器同时也托管着数据库。 实现这一目标的 工程设计值得记录,因为它与第7节中提到的bounded work 原则如出一辙,只是应用到了像素[H](审计和会话日志, 2026年9月6日至7日):

  • The page renders only on input. 空闲时 CPU 使用率约为 0%;无异常

除非用户采取行动,否则不会动画。不存在永续的 动画——这是在“土豆预算”下做出的刻意选择(第9节)。

  • The nebula is baked. 装饰性背景(紫色/蓝绿色/玫瑰色

(光晕和尘埃)在每次调整大小时绘制一次,然后被缓存,其中 在重绘时计算摄像机视差,而不是每帧重新计算。

  • Labels are rationed. 每帧仅绘制约 24 个恒星标签——一个

标签预算——确保重绘成本低廉且文字清晰可读 [H](该 接口代码使用 MAX_LABELS = 24 限定放置位置; gui/planetarium-v1.html)。

  • Requests are protected. 过期响应令牌和中止控制

当用户继续操作时,取消当前查询;双击则暂缓 单击操作,因此不会触发多余的请求;调整大小时会进行防抖处理,并且 画布像素比例设有上限(将调整大小后占用的内存从 (从约 24 MB 降至约 11 MB,分辨率为 1080p)。

  • Accessibility is explicit: 画布角色和 ARIA 标签,运动效果减弱

支撑和键盘行程是在与视觉效果相同的迭代中添加的 波兰语 [H](会议记录,2026年9月7日)。

8.5 The demo that ties it together

该项目的运行演示是单词 cat——或者更准确地说,是 它所属的概念。在资源管理器中搜索西班牙语 gato,前往该 星体,面板上便会显示词义集 princeton-wordnet:02121620-n 及其 在现行语言中的成员词。 在2026年9月6日至7日进行的无界面检查中, 经端到端实际验证的子集已记录在测试日志中—— 英语cat, grimalkinfelis silvestris catus(科学名称 WordNet存储),德语Katze、西班牙语gato、日语——以及 数据库为该同义词集存储的更广泛的成员列表(例如英语 housecat, mouser, puss, tomcat;法语chat, chatte; 德语 Kater; 日语 ネコ;葡萄牙语 gato, bichano)源自导入的词网 成员关系,而非端到端日志;若读者希望获取 完整的当前枚举结果,可重新运行第7.3节中的接受查询 [H with [NV] on the untested tail] 的接受查询(无头端到端日志和实时数据库, 2026年9月6日至7日)。一颗星,六种语言,一个含义:2025年12月的 直觉,在屏幕上清晰可见。 该演示的英语部分 正是第7.2节中的错误曾短暂导致失效的部分:由西班牙语驱动的gato 搜索始终能找到该星,而由英语驱动的cat搜索仅 在覆盖范围修复后才正常工作,且第7.3节中的接受脚本 的存在,正是为了在需要时证明,cat · gato · 猫共享同一颗 恒星。

9 · The workbench: tools, workflow, and the "potato" machine

如果不提及项目所依托的工作台,项目历史便是不完整的。 Lingua Mundi的工作台颇为独特,它所带来的限制条件塑造了 本文中几乎所有的工程决策。

9.1 The potato

托管数据库、API、接口以及 开发环境的机器是一台普通的消费级笔记本电脑:华硕 X751MA,配备 英特尔奔腾 N3540 (Bay-Trail, four cores, no AVX2), 处理器和 8 GB 内存 (7.6 GiB可用空间),配备 5400 rpm hard disk,互联网上行带宽约为 47 KB/s——此数据于2026年9月7日为撰写本文而实时采集 (设备本身显示为 [H]lscpu//proc/meminfo)。该项目的 笔记中将这台机器时而描述为 Atom Z36xx/Z37xx,时而描述为 Pentium N3540——实际上是同一 Bay-Trail 芯片家族的不同命名 [O];2026年初的聊天记录还提及了另一套配置 (一台英特尔Jasper Lake“N5105”设备),第10.2节将其列为 尚未解决的硬件记录冲突。 该工作室亲切地将这台运行中的机器称为 the potato——并制定了一条贯穿整个 记录的规则: one heavy operation at a time、带内存保护的封装程序、不允许永久性 动画、不允许过早部署基础设施(第 4.5 节),且所有高负载任务 均作为自报完成的独立脚本运行,在任务完成时主动报告, 而非被轮询 [H](会话日志与工具集,2026年9月)。 “烘焙,而非重新推导”模式(第7节)、仅输入接口 (第8.4节)以及零LLM成本的研究界面(第9.4节),归根结底 都是“土豆”模式的产物——这证明了紧缩的预算可以成为 设计上的优势,而非局限。

9.2 The software stack

运行系统(已于2026年9月在[H]环境中实机验证):PostgreSQL 16 作为单一数据存储层(第4.5节),FastAPI(Python)作为API 层,SQLAlchemy + Alembic用于模型和迁移,Python脚本 用于导入工具和物化视图管理,以及一个小型 无依赖的Web界面(HTML/CSS/JavaScript),由同一 源提供服务。 辅助组件包括 systemd 用户服务(用于维持 API 及内存/热保护机制的运行)(第 9.5 节)、代码库的每日 GitHub 备份、作为项目记忆的 Obsidian 知识库 (第 9.3 节)、用于接口的无头 Chromium 端到端检查,以及 工作室用于后台自告警的 detach-run + notify 工具集 任务 [H](服务与工具清单,2026年9月)。

9.3 The knowledge base: a project memory that can be audited

From 26 August 2026 the author and his agents maintained a structured knowledge base (an Obsidian vault) in which every working session is logged: work done, decisions made, next actions, and the file where each fact came from, with frontmatter recording provenance and a verified: true/false flag [H] (vault conventions, August–September 2026). The vault is the reason this paper can cite dates and quotes at all: when this draft says "session log, 6 September 2026", it is pointing at a file that exists, was written that day, and carries its own source notes. Two conventions of that vault deserve mention as method: every claim is supposed to state its source, and history is never invented — unconfirmed material is kept but flagged unverified [H] (vault conventions). Those conventions are this paper's conventions (Appendix A).

9.4 Zero-token research and the local-first rule

作者的既定原则——可见于2026年8月29日的项目说明中—— 是:本地化API is研究层面:/lexemes/concepts/analyze 回答关于语料库的问题,而 zero LLM tokens 则用于 [H]。同样的“本地优先”原则也适用于数据(一切 均自主托管;不依赖任何供应商)、资金(仅限免费层级和开放数据 ; 第10节),以及隐私(机密信息绝不离开设备; 知识库是私有的)[H](会话日志,2026年9月)。

9.5 Guardrails on a fragile machine

由于“土豆”号没有顶部空间,工作室搭建了护栏,这些护栏 本身也是工程故事的一部分:一个memory/thermal guard (tools/mem-manager.sh,v2,2026年9月7日上线),当可用内存低于 900 MiB80 °C时发出警告,并在低于500 MiB88 °C时可选地释放 后台单元,此外还包含一个系统级早期OOM 终结器earlyoom -m 8 -s 5,即当可用内存跌破 8%时触发,间隔5秒)[H](实时配置: mem-manager.sh 阈值和 /etc/default/earlyoom,参见 2026 年 9 月 7 日 的记录)。 该工作室的运行规则确保 这些防护措施永远无需启动:one heavy operation at a time、 带内存保护的封装程序,以及针对所有 长时间运行任务的自报警脱离式作业。 长时间的修复任务按 idempotent 原则编写(获取或创建, 若存在则跳过),因此任何中断——无论是重启、断电还是保护 跳闸——所造成的代价仅是时间:修复任务只需重新启动,便能 完成工作(第7.3节)。同样的规范将并发性本身 视为一种需要进行预算管理的资源,如同内存或磁盘一样。

9.6 Governance: licenses, attribution, and the "free forever" decision

Lingua Mundi 中的每个数据集在录入时均附有其许可协议( 存储库中的 docs/DATA_LICENSES.md 清单;在线数据库中的 source 表)[H]:WordNet(宽松型),Open Multilingual Wordnet (按语言划分的许可,主要为 CC BY-SA 和 CC BY)、Wiktionary 和 kaikki(CC BY-SA,包含 GFDL 历史条款)、Wikidata(CC0)、UniMorph (CC BY-SA 3.0)、Universal Dependencies(CC BY-SA 4.0)、JMdict/KANJIDIC2 以及 EDRDG 系列(宽松型,需署名)、 OPUS(按数据集而定)、CLICS 及词频列表(按来源而定)等 [H](许可清单, 2026年9月查阅)。该项目秉持互惠原则:其自身产出的成果 也计划采用自由许可。

funding model 于 2026 年 8 月底至 9 月初的 九天内公开演进,记录显示了每个阶段 [H] 的情况(会话 日志和日历,2026 年 8 月 29 日至 9 月 7 日): 8月29日,最初计划销售一款 离线版 Core-6 词典应用(Texupan,售价29美元或每月9美元);9月1日前,在 store hub 上发布 包含支付链接的应用商店上架信息; 以及——截至9月7日—— 决定将Lingua Mundi改为free forever,由自愿 捐赠资助,而Stripe产品则被直白地命名为“Lingua Mundi——永远 免费”, 一次性价格为5欧元/15欧元/50欧元,月费为3欧元/9欧元/25欧元,并设定了 €2,400这一诚实的年度目标,用于覆盖基础设施成本及下一 种语言的数据工作[H](会议记录,2026年9月7日)。 该账户 是刻意以dormant的方式设立的——在作者 完成支付服务商的身份验证之前,捐赠功能处于禁用状态——因此,在作者的表述中,“ 永远免费”是一个verifiable claim,而非口号 [H](会话日志,2026年9月7日)。 身份验证于2026年9月8日完成,六个支付链接于当天上午上线;它们发布在商店的资金筹集专区 [H](Stripe账户记录及支付链接历史,2026年9月8日)。 面向公众的文本遵循 “工作室之声”规则(前言)和“诚实文案”规则:不炒作、不 夸大其词——这与管理数据库及本文所遵循的纪律一致。

10 · Where the project stands (7 September 2026), its honest limits, and its road ahead

10.1 Current state of the system

2026年9月6日至7日直接在[H]生产系统上进行的测试(具体查询语句见 附录A):

  • Corpus (pre-repair snapshot, 6–7 September 2026): 96,434 个概念 · 1,238,383 个词素 · 1,608,018 个词义 · 171,672 个关系,涵盖六种现行语言(英语、西班牙语、法语、德语、葡萄牙语、日语)——SQL 的统计数据在两次测量日期中均完全一致。
  • Corpus (post-repair, 8 September 2026): 125980 个概念 / 125980 个语义集 / 352333 个英语词素,如修复报告(lm-en-coverage-REPORT-2026-09-08.txtRESULT: PASS)中所记录; cat 星集 princeton-wordnet:02121620-n 中的多语言成员涵盖英语、西班牙语、日语、德语和葡萄牙语(cat、gato、猫、Katze、Gato doméstico)。
  • Ranking views: concept_sky_rank 94,498 行;concept_lang_rank

218,120 行;concept_word_rank 在创建时有 338,378 行(实时重新计数) 被拒绝授予标准数据库角色;已标记为 [NV])。

  • Performance: 默认天空 ≈ 0.25 s 暖(排名开始前 8.6 s)

(浏览量);包含“words”一词的深度1,000星查询约需1.1秒(在出现“words”一词之前需时超过60秒) 视图);图路径搜索耗时(以毫秒为单位);搜索时间约为 0.5 秒(预热后)/ 约 10 秒 硬盘页面缓存中的“冷数据”。

  • Interface: 语义图浏览器已在 API 的网站源上上线,其中包含

所有仪器(测距盘、六分仪、天体标记、文字罗盘、航向 (日志、纪元戳)已通过 23/23 次无头浏览器端到端检查的验证,检查地址为 2026年9月6日至7日。

  • English coverage repair:——无上限的英语版 WordNet 再导入、关联、集成、视图刷新及端到端验证链 (第7.3节)于2026年9月7日上午启动,并于2026年9月8日22:19(2026-09-08 22:19:12)顺利完成。 其验收关卡已通过:该链自身的报告(lm-en-coverage-REPORT-2026-09-08.txtRESULT: PASS)记录了概念关联的英语catprinceton-wordnet:02121620-n上的释义,其多语言条目包括cat、gato、 猫、Katze、Gato doméstico [H](报告,2026年9月8日)。
  • Governance: 捐赠频道已上线——身份验证已于 2026 年 9 月 8 日完成,商店中已发布六个支付链接;

对作者的支付服务商进行验证;每天对代码库进行备份; 知识库最新。

10.2 What is honestly not known, and what is unresolved

根据本工作室的核实规范,本文必须明确说明 无法核实的内容,并记录不同来源之间的矛盾之处。其中 重要的包括:

  1. The "Core 6" discrepancy. 作者的个人语言集(已记录)

(2026年8月29日)支持西班牙语、英语、日语、法语、Italian以及 葡萄牙语。实时数据库支持的六种语言是英语、西班牙语、 法语、German、葡萄牙语和日语。德语取代了意大利语,在 该数据库未留下任何现存的书面说明;意大利语 row 和 Italian 数据集此前已完成注册,但实时表中仍包含 德语 [H],理由为 [NV](另见第 4.2 节关于 该规范的级别,其中包括普通话和意大利语,但不包括德语—— (三个月内出版了三种不同的语言版本)。

  1. Corpus-count drift within a single day. 一份技术文件,撰写于

2026年9月6日的数据显示,共有1,146,066个词素/1,595,537个词义,而 当晚,SQL直接报告的数据为1,238,383 / 1,608,018(概念和 关系相同:96,434 / 171,672);该同一会话的日志 “evening”还包含第三类、即中间类词汇(约115万个词素), 这与当天仍在抵达的进口情况一致。各语言的总计 与SQL这一数据相符,因此该档案中的数字似乎来自 不同的时刻或滤镜;这种差异在 记录 [H] 及其对账记录 [O]。本文引用了 带日期的SQL数据。

  1. Hardware records conflict. 运行实时系统的机器位于

本文直接截取了2026年9月的画面,显示为华硕X751MA 配备英特尔 Pentium N3540(Bay-Trail)处理器,8 GB 内存(第 9.1 节) [H]。书面记录则更为杂乱:项目笔记中描述了这个盒子 作为英特尔凌动 Bay-Trail(Z36xx/Z37xx)和奔腾 N3540 ——该 同一代硅芯片,但有两个产品名称:[O]——而此前 2026年的对话记录提到了另一台机器,一台英特尔 Jasper Lake "N5105"(配备 12 GB 内存,2026 年 1 月及以后)作为 “一款 Jasper Lake 4 芯片”(2026 年 5 月)和“英特尔 Jasper Lake N5105,4 GB” (2026年年中内存文件)。Jasper Lake 并非 Bay-Trail 架构的芯片,因此该 这些记录要么描述了这一年中两台不同的机器,要么 助理的标注错误;现存证据无法确定究竟是哪一种情况,而且 重点在这里被标出,而不是被轻描淡写地带过 [H],用 对账 [NV](会话日志和人工智能对话记录, 2026年1月至9月)。

  1. Data-quality warnings from the September audit: 语料库包含

178,576组重复词条对;124,790个无词义的词素;占33.9%的 定义为空;且(在英文版本修复之前)71.7%的词义尚未 与概念相关联。同一项审计发现,参照完整性得以维护 在整个过程中(总和精确,数据库层级无悬空行或孤立行): 71.7%这一数字描述的是not yet linked to a concept这几个字母,该 设计了“可见孤行”状态,而非断开的引用——一种诚实的 这一区别是该项目在对齐工作期间有意保留的 续 [H](审计,2026年9月5日至6日)。

  1. Unmeasured or pending: 在“土豆”以外的硬件上的性能表现

从未进行过测量;该项目目前尚无公众用户,因此 没有实际使用指标;该工作室的法律结构未在 相关记录;“朝鲜半岛南北双方”建模问题、粤语数据匮乏, 此外,台湾WordNet的许可审查工作现已启动(第10.3节)。

10.3 The road ahead

该路线图于2026年8月29日获得用户批准,是6月 手稿中七个图[H](项目说明)的成熟版本: 语音学/音系学、 形态学(已导入)、句法学(已导入)、语义学(已导入)、词典编纂 (已导入)、语料库(已导入),以及——已排入待办列表——话语、词源学,还有 对应层和用法层,外加最终将推出的公共网络界面。在 近期,已记录的计划如下([H],会议记录,2026年9月7日 ):

  • The CJKV family. 该模式计划支持的下一批语言是

普通话(cmn)、粤语(yue)、韩语(kor)和越南语(vie)。他们的 日程安排取决于一次真实可靠的数据可用性调查 关于开放数据领域能提供什么:OMW Wiktionary 词网确实存在 普通话(19,079 行)、粤语(527 行)、韩语(9,268 行)以及 越南语(5,498);普通话(12.3万个语素)和粤语的UD语料库 (1.4万),韩语 (8万 GSD 加上 35万 KAIST),越南语 (5.8万)。粤语是 稀缺的那种——没有大型词网,树形语料库也很小——以及台湾地区 Wordnet 许可证正在审核中 [H](会话日志和数据 库存,2026年9月7日)。尚未将任何CJKV数据集导入到 截至本草案版本的实时语料库;该家族的具体时间安排尚未确定 在审查结果出来之前。

  • Research-v1 interface panes(词汇透镜、血脉攀升、领域卡,

(笔记本、对比表)已于6日设计完成并获得后端部门批准 2026年9月,排在仪器[H]的制造任务之后。

  • Publication. 本文是人工智能生成的初步草稿;该

由人工撰写的出版物正在制作中(前言部分)。

  • Languages without end. 该架构的承诺——将一种语言纳入其中

row plus 数据集——是该项目明确提出的长期目标,而 募捐宣传语直截了当地指出:Lingua Mundi 最初支持六种语言, 设计用于无限期添加它们 [H](会话日志,2026年9月7日)。

10.4 Conclusion

2025年12月3日,一切始于对免费词典文件的请求,如今却已发展成为 一个基于开放数据、可运行且可查询的六语义图,由 一个人仅凭免费工具和一台2014年的笔记本电脑构建而成。 支撑这一项目的理念——即 语义是多语言数据的自然单位;对齐必须 明确且标注,绝不能默默猜测;昂贵的计算 应“一次计算,多次读取”;预算约束是 一种设计工具;无论是数据库中的还是论文中的每一项主张,都应附有 来源及其日期——这些理念虽非新颖,但正是true的体现,而该项目 证明了一人便能付诸实践。 该项目最宝贵的成果 或许根本不是那个数据库,而是一个独立研究者能够 在公众面前构建诚信基础设施的示范:测量他所测量的内容,标注 他所标注的日期,展示他的孤立条目,并信守承诺——一颗星,六 种语言,而整片星空仍在前方。

Built in a cave, with a bunch of scraps.

References

APA 第7版。参考文献信息已于2026年9月7日根据出版商网页 和数字对象标识符(DOI)记录进行了核对。软件和数据 来源的引用格式遵循APA关于软件/数据集的规范。(仅列出 正文中引用的文献。)

Bond, F., & Foster, R. (2013). “连接与扩展一个开放的多语言 词汇网”。载于《第51届计算语言学协会 年会论文集》(第1352–1362页)。计算语言学协会 。https://aclanthology.org/P13-1133/

美国盲文研究所。(2019)。Atkinson Hyperlegible [计算机 字体]。https://brailleinstitute.org/freefont

Breen, J. W. (2004). JMdict:一部日语-多语种词典。载于 《多语种语言资源研讨会论文集(COLING 2004)》(第65–72页)。COLING。 https://aclanthology.org/W04-2209/

电子词典研发组。(无日期)。JMdict / EDICT 日英词典项目 [数据文件和文档]。 2026年9月7日检索自 https://www.edrdg.org/jmdict/edict_doc.html

费尔鲍姆,C.(主编).(1998). WordNet: An electronic lexical database. 麻省理工学院 出版社. https://mitpress.mit.edu/9780262561167/wordnet/

盖亚合作组,布朗(Brown, A. G. A.)、瓦莱纳里(Vallenari, A.)、普鲁斯蒂(Prusti, T.)、德·布鲁因(de Bruijne, J. H. J.)、巴布西亚奥(Babusiaux, C.),……兹维特(Zwitter, T.)(2018)。 盖亚数据发布第2版: 内容与观测特性概要。Astronomy & Astrophysics, 616, 文章 A1。https://doi.org/10.1051/0004-6361/201833051

埃尔南德斯,R.(2026年6月1日)。Lingua Mundi:一种面向 概念锚定语言模型的语义基础设施(第1–7版)[未发表手稿; 修订和审核记录保存在作者的对话日志 存档中]。

埃尔南德斯,R.(2026年7月24日)。《多语言词汇平台——工程 规范》(2.0版)[未发表的规范文档;文本 已提取并存档]。

基洛夫,C.,科特雷尔,R.,西拉克-格拉斯曼,J.,瓦尔特,G.,维洛莫娃,E., 夏,P., 法鲁基,M.,米尔克,S. J.,麦卡锡,A.,库布勒,S.,亚罗夫斯基,D., 艾斯纳,J.,& 胡尔登,M. (2018). UniMorph 2.0:通用形态学。载于 《第十一届语言资源与评估国际会议 (LREC 2018)论文集》*. 欧洲语言资源协会。 https://aclanthology.org/L18-1293/

麦卡锡(McCarthy),A. D.;基洛夫(Kirov),C.;格雷拉(Grella),M.;尼迪(Nidhi),A.;夏(Xia),P.;戈尔曼(Gorman),K.; 维洛莫娃,E.,米尔克,S. J.,尼古拉伊,G.,西尔弗伯格,M.,阿尔汉格尔斯基, T.,克里扎诺夫斯基,N.,克里扎诺夫斯基,A.,克利亚奇科,E.,索罗金,A., 曼斯菲尔德,J.,埃尔恩施特赖茨,V.,平特,Y.,雅各布斯,C. L.,…… 亚罗夫斯基,D. (2020). UniMorph 3.0:通用形态学。 收录于《第十二届 语言资源与评估国际会议(LREC 2020)论文集》 (第3922–3931页)。欧洲语言资源协会。 https://aclanthology.org/2020.lrec-1.483/

Meyer, C. M. 与 Gurevych, I. (2012). Wiktionary: 专家编纂词典的新竞争对手?探索协作式 词典编纂的可能性。 收录于 S. Granger 与 M. Paquot(编),Electronic lexicography (第 259–292 页)。牛津大学出版社。 https://doi.org/10.1093/acprof:oso/9780199654864.003.0013

米勒,G. A. (1995). WordNet:一个英语词汇数据库。 Communications of the ACM, 38(11),39–41。 https://doi.org/10.1145/219717.219748

Nivre, J., de Marneffe, M.-C., Ginter, F., Hajič, J., Manning, C. D., Pyysalo, S., Schuster, S., Tyers, F., & Zeman, D. (2020). 《通用 依存关系 v2:一个不断扩充的多语言树库集合》。收录于 第十二届语言资源与评估国际会议 (LREC 2020)论文集(第4034–4043页)。欧洲语言资源 协会。https://aclanthology.org/2020.lrec-1.497/

普林斯顿大学。(无日期)。About WordNet。WordNet。于2026年9月 7日检索自https://wordnet.princeton.edu/

SIL International. (无日期). ISO 639-3. 2026年9月7日检索自 https://iso639-3.sil.org/

德·索绪尔,F.(1983)。Course in general linguistics(C. Bally、A. Sechehaye 与 A. Riedlinger 编;R. Harris 译)。达克沃思出版社。 https://www.bloomsbury.com/us/course-in-general-linguistics-9781472508829/ (原著出版于1916年)

Speer, R. (2022). wordfreq:多语言词频数据库 (3.0版)[计算机软件]。GitHub. https://github.com/rspeer/wordfreq

Tiedemann, J. (2012). OPUS 中的并行数据、工具与接口。载于 《第八届语言资源与评估国际会议 (LREC 2012)论文集》(第 2214–2218 页)。欧洲语言资源 协会。https://aclanthology.org/L12-1246/

Vrandečić, D., & Krötzsch, M. (2014). Wikidata:一个免费的协作式 知识库。Communications of the ACM, 57(10), 78–85. https://doi.org/10.1145/2629489

维基媒体基金会。(无日期)。Wiktionary: The free dictionary。检索于 2026年9月7日,来源:https://www.wiktionary.org/

Zipf,G. K.(1949)。Human behavior and the principle of least effort。 艾迪生-韦斯利出版社。https://archive.org/details/humanbehaviorpri0000zipf

Appendix A · Sources, method, and verification

A.1 The annotation convention

遵循该研究室的严谨标准(源自其调查 工作),本文中的论点在读者需要了解其 认识论地位时均标有标签:[H] = 已核实的事实——本文参考的测量数据、代码或带日期的 来源; [O] = 引用的解释或 观点;[NV] = 未核实/未查到。摘要 和正文中的每张图表要么是标注了日期的[H]测量数据,要么附有说明标签。

A.2 Source families consulted (access 6–7 September 2026)

#SourceWhat it provided
1Live codebase: …/SafeMode/Software Development/LinguaMundi/lingua-mundi (api/, core/, schemas/, importers/, scripts/, docs/, gui/)Architecture, schema, importers, materialized-view SQL, API routes, GUI code
2Live database lingua_mundi (PostgreSQL, 127.0.0.1:5433), direct SQLCorpus counts, language table, synset membership, concept links
3Live API (127.0.0.1:8765): /languages, /graph/sky, /graph/star, /graph/word, /graph/path, /openapi.jsonEndpoint behavior, warm/cold latencies, gzip
4Web interface (127.0.0.1:8765/gui) + headless-browser checksUI behavior; 23/23 end-to-end checks recorded 6–7 Sep 2026
5Vault knowledge base (session logs 26 Aug–7 Sep 2026, handoffs, project notes, conventions)Milestones, decisions, quotes, conventions, dates
6ChatGPT conversation archive (export 5 Sep 2026; 421 conversations with content)Origin and growth conversations, verbatim quotes (Section 1, 3, 4)
7DeepSeek data export (6 Sep 2026; 215 conversations)June 2026 manuscript revision cycle, setup logs
8Claude.ai data export (extracted 6 Sep 2026; legacy-memory file updated 7 Sep 2026)Long-horizon context, project roles
9Personal artifacts in the author's home directory (file timestamps, scripts, specification PDF, journals)Pre-project chronology (Nov–Dec 2025), engineering specification, journals
10Published scholarly and data sources (see References)Background and related work

代表性验证查询(运行于2026年9月7日,角色lingua): SELECT count(*) FROM concept|lexeme|sense|relation → 96,434 / 1,238,383 / 1,608,018 / 171,672; SELECT code FROM language → 德语、英语、法语、日语、葡萄牙语、 西班牙语;每种语言在词义集 02121620-n 中的成员资格(第 8.5 节);该 项目自有的接受脚本 verify-lm-cat-demo.sh(第 7 节)。

A.3 Key numbers with dates (compressed timeline)

DateEvent / figure
2025-11-11KANJIDIC2 downloaded (first dataset, file timestamp)
2025-12-03Origin message: "unified multilingual database" (ChatGPT log)
2025-12-05OMW data downloaded; first extract scripts
2025-12-08…16Merge/unified pipeline; four-entity (concept/sense/lexeme/grapheme) JSONL schema
2026-05-01OMW v2.0 coverage study
2026-05-23"Multilingual Lexical Platform" spec master (markdown)
2026-06-01Lingua Mundi named; manuscript V1–V7 revision cycle (DeepSeek + ChatGPT audits)
2026-07-17/18Code scaffolding; feasibility conversation; journal
2026-07-24Engineering Specification V2 (104 pp., PDF)
2026-08-13Lean-stack decision; semantic interaction layer
2026-08-19…25Japanese demo builds; 23 Aug concept descriptions
2026-08-27Daily GitHub backups begin
2026-08-29"LinguaMundi IS the lexicon" decision; roadmap approved; Core 6; Postgres live; UD importer
2026-08-30API routes (CORS, /lookup, /kanji); 27 tests green; first /gui deploy
2026-08-31Import restart (~1.13M rows); English OMW cap seeded the cat bug
2026-09-01Planetarium naming; ≈1.54M rows; store live
2026-09-05Deep audit; pagination fixes; 1,238,383 lexemes
2026-09-06Enrichment audit; materialized-view overhaul (94,498 / 218,120); words bake (338,378); GUI pivot to semantic-graph explorer; cat root cause; research-v1 approval
2026-09-07Instruments live (23/23 E2E); donation setup (dormant); English coverage repair chain launched; CJKV data-availability reconnaissance; this paper drafted
2026-09-08English coverage repair verified complete (8 September 2026 at 22:19); acceptance gate PASS recorded in lm-en-coverage-REPORT-2026-09-08.txt

A.4 Contradictions and unresolved items

如第 10.2 节所述:意大利语/德语 Core-6 数据差异; 同日语料库计数偏差(dossier 1,146,066 与 SQL 1,238,383 个词素, 当晚的会话日志中还出现了一个第三个中间数值, 该数据已按语言与 SQL 的数值进行了核对);硬件记录冲突 (Atom Bay-Trail 与 Pentium N3540 及 2026 年早期记录中的 Jasper Lake N5105 存在冲突——第 10.2 节第 3 项);71.7% 的未关联词义以及 其他数据质量警告; 以及未经核实/未记录的项目:8月26日之前的 精确仓库创建日期、语言集变更的原因、 6月1日审计文本的模型来源(这些审计记录保存在 作者用户端的ChatGPT对话中;但出口文件中未独立注明 撰写了哪一轮审计在导出文件中未得到独立证实—— 参见第3.3节)、concept_word_rank实时重新计票(权限被拒绝), 以及该工作室的法律结构。

A.5 Methodology notes

  • 被测系统 is 是生产系统;正在进行热测

±0.3 秒的硬盘噪声;日期和时间以记录本身的格式显示 时区(除非另有说明,否则为中部时间;DeepSeek日志使用+08:00,且曾 (已转换)。

  • 引文均直接摘自所引用的日志/文件;省略号表示省略部分;

文中出现的西班牙语引文均附有英文注释。

  • 本文本身就是一份由人工智能生成的草稿(前言说明);它是

本著作是在作者指导下根据上述资料撰写的,且未 已通过同行评审。验证工具:直接 SQL、HTTP 查询、 无头浏览器检查和源文件读取;未就此提出任何索赔 当源存在时的记忆。

Appendix B · Glossary — plain-language terms used in this paper

How to use this glossary: the first time a technical term appears in the paper it is underlined with dots — hover it (or tap it) for a quick definition, or click it to jump here. This list is alphabetical.
  • Alignment——指将一种语言中的某个词与另一种语言中的某个词视为同义的行为。
  • API——一种允许一个程序向另一个程序请求数据的接口(例如,词典应用向Lingua Mundi数据库查询某个单词)。
  • Autonym——该语言母语者对该语言的称呼(西班牙语使用者将西班牙语称为español)。
  • Bake——该项目中用于描述“将一个计算成本高昂的答案计算一次、存储起来,然后多次读取”的做法(其工作原则是“预先计算,不要重复推导”)。
  • Breadth-first search——一种像投石入水般分层向外探索图的方法,用于寻找两点之间的最短路径。
  • CJKV——这是涵盖汉字、日文、韩文和越南文这一书写系统家族的简称(这些字母分别代表各文字系统的名称)。
  • Concept——一种跨越语言的含义(在本文中指“家猫的概念”,而非任何特定词汇)。
  • Corpus —— 作为证据使用的大量语言数据(文本或词典条目)。
  • Dataset — 来自单一数据源的打包数据集,具有其自身的格式和许可协议。
  • Derivation / etymology — 派生是指如何根据现有词汇构出新词(run → runner);词源则是词汇在不同时代和语言中的演变历史。
  • ETL — 提取-转换-加载(ETL):从外部数据源读取数据、对其进行重塑,并将其存储到数据库中的过程。
  • FastAPI —— 这是一个免费的开源 Python 框架,用于构建本项目所提供的此类界面(API)。
  • Full-text search — 通过匹配存储文本中的关键词来搜索数据库,而非通过精确的标识符进行搜索。
  • Grapheme —— 一个文字符号:字母、音节符号或汉字。
  • Graph——在本文中,指由带类型的关系(边)连接起来的一组含义(节点)。
  • Gzip——一种标准的压缩方法,可在文件通过互联网传输前将其压缩得更小。
  • HTTP——网络浏览器和 API 用于通过互联网请求和接收数据的协议。
  • Hypernym / taxonomy — 上位词 = “一种”:felinedomestic cat 的上位词。分类法就是由此形成的种类树。
  • Importer——一个能够读取一个外部数据集,并将其写入 Lingua Mundi 自身数据模型的程序。
  • Index——一种数据库结构,能让查询快速找到行,就像书的索引一样,而不必逐页翻阅。
  • Inflection / morphology —— 词形变化是指为了符合语法规则而改变单词的形式(run → ran);形态学则是对这些形式的研究。
  • Instance-of / part-of —— 图中存在两种关系类型:“这是那个的一个例子”(猫是哺乳动物这一类别的实例)和“这是那个的一部分”(爪子是猫的一部分)。
  • Interlingua——一种语言间的共享中间表征:不要直接将西班牙语翻译成英语,而是先将西班牙语转换为语义,再转换为英语。
  • ISO 639-3——这是一项国际标准,为每种人类语言分配了一个唯一的三字母代码(spa = 西班牙语,jpn = 日语)。
  • JMdict / KANJIDIC2 — JMdict 是一部大型日语-多语言词典;KANJIDIC2 是其配套的汉字(日语中使用的汉字)文件,其中包含读音和释义。
  • JSON Lines —— 一种简单的文本格式,每行代表一条数据记录,用于该项目最早期的管道文件。
  • Kaikki —— 这是对 Wiktionary 数据进行机器可读提取的结果,相比原始页面,更便于程序读取。
  • Kanji——日语书面语中使用的源自中国的汉字。
  • Lemma —— 某个单词的词典形式(即查词时使用的形式:cat,而非catsrun,而非ran)。
  • Lexeme —— 某种特定语言中的词形(字符串 cat)。
  • License——规定数据如何被使用和共享的法律条款;“开放”许可允许在注明出处的情况下重复使用(例如,CC BY-SA)。
  • Long tail——齐普夫分布(参见Zipf定律)最远端的大量稀有物品。
  • Materialized view —— 一种存储的、预先计算好的查询结果,会按计划进行刷新,因此重复查询时无需重新执行计算(即“bake”模式)。
  • Morphology——研究词形及其在语法中的变化(参见“词形变化”)。
  • Natural language —— 指人们实际口头表达和书面书写的人类语言,与编程语言相对。
  • Node / edge — 在图中,节点是一个元素(此处指一个概念),边是两个元素之间的连接(此处指一种带类型的关系)。
  • OMW / Open Multilingual Wordnet —— 与英语 WordNet 对齐的词网集合。
  • OPUS —— 一个由网络和电影字幕中收集的大量翻译句子组成的集合。
  • Orphan sense —— 词典中尚未与共享概念建立关联的词条;保持可见而非隐藏。
  • Pagination — 将冗长的结果列表拆分为带页码的分页,而不是一次性发送所有内容。
  • Part of speech —— 词的词性:名词、动词、形容词等。
  • Pipeline——一个由多个程序组成的流程,将数据从原始源经由清理步骤传输至最终存储位置。
  • Plugin / registry — 插件是针对某个数据集的小型附加程序;注册表是这些插件的唯一权威列表。
  • Polysemy——一个词,多种含义(bank:河岸/一笔钱)。
  • PostgreSQL —— 一个免费的、开源的关系型数据库(Lingua Mundi 系统将所有数据都存储在此数据库中)。
  • Relation —— 两个概念(家猫 is a 猫科动物)之间的一种带类型的有向关联。
  • Schema——数据库的蓝图:包含哪些表、每行包含什么内容,以及各表之间如何相互关联。
  • Sense——某部词典中对某个词的某个释义。
  • Signifier / signified —— 索绪尔提出的词的双重属性:其发音或形态(能指)及其所指的概念(所指)。
  • Sky brightness / magnitude——该项目根据某个词义关联的语言和词汇数量,对其“重要性”进行的排名。
  • SQL——用于向关系型数据库提出查询的标准语言。
  • Synset——在某些语境下,这一组词可以表达相同含义;在Lingua Mundi中,一个语义集的含义被存储为一个概念。
  • Token —— 在机器学习中,指模型读取或写入的文本片段(通常是一个单词或单词的一部分)。
  • Treebank — 一组标注了语法信息(哪个词起什么作用)的真实句子。
  • UD / Universal Dependencies——一个社区项目,致力于在开放许可下发布多种语言的、带有语法标注的句子数据。
  • UniMorph —— 一个多语言的词形(屈折)数据库。
  • URI——一个事物对应的稳定且唯一的地址,此处用于表示概念(例如,princeton-wordnet:02121620-n 代表家猫)。
  • Wikidata —— 维基媒体的结构化知识库,包含带有机器可读标识符的陈述,依据 CC0 协议发布。
  • Wiktionary —— 由维基媒体基金会托管的协作词典。
  • Word form —— 一种语言中某个词的一种拼写方式;参见“词素”。
  • WordNet——最初的英语按语义组织词汇数据库(普林斯顿大学);OMW将其他语言与该数据库进行对齐。
  • Wordfreq —— 一个汇集了多种语言词频列表的数据库,用于根据词汇的常见程度对其进行排名。
  • Writing script —— 一种语言所使用的字符集(拉丁字母、阿拉伯字母、汉字等)。
  • Zipf's law——即“少数词汇占据了绝大多数使用量,而罕见词汇构成的‘长尾’则占据了剩余部分”这一观察结果。