Lingua Mundi: Building a Language-Agnostic Map of Meaning from Open Lexical Data

One idea in every language, on one star.

A project history and technical account · AI가 생성한 초안 · RHLS 스튜디오 · 2026년 9월 7일

RHLS 매장 · Lingua Mundi · 블로그 · 영어 오디오 · English · Español · Français · Deutsch · Italiano · Português · 日本語 · 한국어 · 简体中文 · 繁體中文 · 廣東話 · हिन्दी · العربية


Notice — preliminary AI-generated draft. This document was drafted by an artificial-intelligence research agent (operating inside the RHLS "DeepSeek Harness" toolchain) at the direction of Raciel Hernández Hernández, the project's author. It is not the final publication: the authoritative, human-authored paper is still in development by Mr. Hernández. Every fact, figure, and quotation in this draft traces to a dated primary source (conversation logs with ChatGPT, Claude, and DeepSeek; project journals and session logs; the software repository and its documentation; and direct measurements of the live database and application programming interface), and the sources are listed in the appendix. Statements that could not be verified are explicitly marked. No claim in this draft should be treated as peer-reviewed or as final wording.

How to read this paper. 이 책은 not 전산 언어학자 및 not 프로그래머를 위해 쓰였습니다. 기술 용어가 처음 등장할 때는 점선 밑줄로 표시됩니다. 마우스를 올려놓거나(또는 탭하면) 일반 용어로 된 정의를 볼 수 있으며, 클릭하면 전체 용어집 (부록 B)으로 이동합니다. 모든 인용문과 명명된 도구 또는 데이터 소스는 원본 출처나 공식 문서로 연결되어 있습니다. 단순히 내용만 알고 싶은 독자는 1~3절과 10절을 읽으면 되며, 중간 절들은 엔지니어링 과정을 상세히 다루고 있습니다.

Author and contribution statement. Lingua Mundi는 멕시코 타바스코에 거주하는 독립 연구자이자 번역가인 라시엘 에르난데스 에르난데스(Raciel Hernández Hernández)에 의해 구상, 설계되었으며, 현재 개발 중입니다. 개발은 OpenAI의 ChatGPT, Anthropic의 Claude, DeepSeek의 채팅 및 추론 모델 — 이들과 저자는 프로그래밍 파트너, 검토자, 문서 작성 보조 도구로 활용합니다. 이 초안 자체는 저자의 지시에 따라 AI 에이전트가 작성했으며, 스튜디오의 검증 관례를 따릅니다. [H]는 날짜가 명시된 출처, 측정값 또는 코드를 통해 검증된 사실을 나타내며; [O]는 출처가 명시된 해석이나 의견을 나타내며, [NV]는 검증할 수 없었던 진술을 나타냅니다. 공개된 텍스트는 스튜디오의 관례에 따라 저자의 개인적인 어조가 아닌 스튜디오의 어조로 작성되었습니다.

[H] Studio-voice rule (session log, 7 September 2026): "Studio/PR voice on all external/pitch copy — never Rex's personal voice." [H] Honesty rule: "No lies / no fake confidence" (studio conventions, September 2026).

Abstract

인간이 만든 사전과 워드넷은 by language의 순서로 구성되어 있습니다: 스페인어 단어 파일, 영어 단어 파일, 일본어 단어 파일. 하지만 “집고양이”와 같은 의미는 스페인어, 영어, 일본어 중 어느 하나의 것이 아닙니다. 이는 모든 언어가 공유하는 의미이며, 각 언어는 단지 서로 다른 표면 형태로 이를 가리킬 뿐입니다: gato, cat, chat, Katze, . Lingua Mundi(“세계 언어”)는 개방적이고 무료이며 언어에 구애받지 않는 어휘 지식 기반으로, 기존의 구성 방식을 뒤집으려 시도합니다. 즉, 언어별 사전을 만드는 대신, concepts (의미)를 한 번 저장하고, 오픈 데이터 커뮤니티의 다국어 워드넷을 정렬 키로 사용하여 각 언어의 단어를 이러한 공유된 의미에 연결합니다. 이 프로젝트는 한 사람이 2014년형 노트북 한 대 2014년형 노트북(4코어 인텔 펜티엄급 프로세서, 8GB RAM, 5400 rpm 하드 디스크, 느린 인터넷 연결 — 이 논문에서 직접 캡처한 실시간 시스템을 호스팅하는 기계; 9.1절 참조)에서 단 한 명이 예산 없이, 오직 오픈 어휘 데이터만을 사용하여 개발하고 있다. 2025년 12월부터 2026년 9월 사이에 이 프로젝트는 다운로드한 사전 파일들이 담긴 폴더에서, 6개 라이브 언어(영어, 스페인어, 프랑스어, 독일어, 포르투갈어, 일본어)를 아우르는 96,434 concepts, 1,238,383 word forms (lexemes), 1,608,018 word senses, 1,608,018 word senses, 171,672 semantic relations를 아우르는 6개 실제 언어(영어, 스페인어, 프랑스어, 독일어, 포르투갈어, 일본어)를 지원하는 PostgreSQL 데이터베이스로 성장했으며, 밀리초 단위로 응답하는 쿼리 API, 그리고 “의미의 지도” 스타일로 디자인된 웹 인터페이스 — 한 별이 cat · gato · 猫 · chat · Katze를 동시에 나타낼 수 있는 탐색 가능한 별자리 지도 — 로 발전했습니다. 이 논문은 이 프로젝트의 지적 기원(철자가 아닌 의미가 다국어 언어 데이터의 자연스러운 단위라는 직관)과, 설계상의 수학적 및 언어학적 원리(언어에 구애받지 않는 엔티티 모델, 신셋(synset) 기반 개념 정렬, 유형화된 관계의 분류 체계, 지프(Zipf) 법칙에 따른 순위 매기기, 그리고 데이터베이스 관행에서 차용한 “구워라, 다시 도출하지 마라(bake, don’t re-derive)”라는 구체화된 뷰 패턴); 공개 데이터 소스와 해당 라이선스; 구축에 사용된 도구와 인간-AI 워크플로우; 사용자 인터페이스와 그 교육적 설계; 진행 과정에서 발견된 인프라 오류들 — 잠시 동안 영어 단어 cat를 이 단어 자체의 개념에서 보이지 않게 만들었던 '무음 잘림 버그'를 포함함(2026년 9월 7일에 시작된 수정 체인은 2026년 9월 8일에 완료된 것으로 확인됨); 프로젝트의 현재 상태; 그리고 향후 계획. 이 논문은 또한, 암묵적으로, 한 명의 결단력 있는 사람이 무료 도구와 빌린 컴퓨팅 자원을 활용해 오픈 데이터를 바탕으로 무엇을 구축할 수 있는지에 대한 사례 연구이자, 작은 프로젝트를 큰 프로젝트로 성장시킬 수 있을 만큼 정직하게 만드는 공학적인 습관(측정, 날짜 기록, 라벨링, 검증되지 않은 부분을 인정하기)에 대한 사례 연구이기도 하다.

이 초록에 포함된 수치와 통계 자료는 2026년 9월 6일부터 7일까지 측정된 것입니다. 구체적인 검색어, 날짜 및 출처는 부록 A를 참조하십시오.

96,434개념 · 의미
1,238,383어형 · 어휘소
1,608,018단어 의미
171,672의미 관계
6가동 언어
0.25 s기본 하늘 · 웜
AI 생성 예비 초고. 이 문서는 프로젝트 저자 Raciel Hernández의 지시 아래 인공지능 연구 에이전트가 작성했습니다. 최종 발행본이 아닙니다 — 저자가 직접 쓰는 논문은 아직 개발 중이며 — 동료 검토도 거치지 않았습니다. 모든 사실과 수치는 부록에 나열된 날짜가 있는 1차 출처로 거슬러 올라갑니다. 검증되지 않은 진술은 명시적으로 표시되어 있습니다. 저자의 승인 없이 인용하지 마십시오.

1 · The intuition: why dictionaries are the wrong shape

One concept, six languages: the domestic-cat synset 02121620-n 02121620-n domestic cat EnglishcatgrimalkinhousecatmouserpussSpanishgatoFrenchchatchatteGermanKatzeKaterPortuguesegatobichanoJapaneseネコ
One concept, six languages — members of the domestic-cat synset princeton-wordnet:02121620-n (verified subset, September 2026).

언어를 배우는 사람이라면 누구나 이런 혼란을 느껴본 적이 있을 것입니다. 영어-스페인어 사전에서 ‘cat’를 찾아보면 ‘gato’가 나오고, 스페인어-일본어 사전에서 ‘gato’를 찾아보면 ‘’가 나옵니다. 사전 세 권을 뒤져본 끝에, 이미 짐작했던 사실을 확인하는 데 오후 한나절을 허비하게 됩니다. 바로 같은 개념— 야옹거리는 작은 가축화된 육식동물—이 세 번이나, 세 개의 별도 파일에서, 세 개의 서로 다른 기관에 의해, 세 개의 서로 다른 식별자를 가지고 설명되어 있으며, 다른 두 항목과는 단 한 번도 연결되지 않았다는 사실입니다.

Lingua Mundi의 배경이 되는 직관은, 이것이 언어학적 데이터에 적합한 형태가 아니라는 점입니다. 의미는 단 한 번만 존재합니다. 단어는 여러 번 존재한다. meanings를 일급 객체로 저장하고, words를 각기 다른 언어가 그 의미에 붙이는 라벨로 취급하는 데이터베이스를 통해, 사람은 (또는 프로그램)이 단 하나의 공유된 매핑을 통해 어떤 언어에서든 다른 언어로 이동할 수 있게 해줄 것이며, 학습자는 cat, gato, chat, Katze, and 가 암기해야 할 다섯 가지 사실이 아니라, 하나의 사실이 다섯 가지 옷을 입고 있는 것임을 한눈에 파악할 수 있게 해줄 것입니다.

이 직관은 번개처럼 갑자기 떠오른 것이 아니었다. 약 1년에 걸쳐 특정 인물의 일상적인 업무 속에서 서서히 자라난 것이었으며, 이에 대한 가장 초기의 기록적 흔적은 놀라울 정도로 소박하다.

1.1 The first message

3 December 2025에서 작성자는 ChatGPT와 대화를 시작하며 다음과 같이 입력했습니다(원문 그대로 인용; 이 대화는 4개월 반 동안 계속되었으며, 마지막 수정일은 2026년 4월 21일입니다). [H]:

"I want to find free dictionaries similar to JMDICT and Kanjidict2 for the following languages: Spanish, English, French, Italian, Portuguese, Chinese, Korean and Vietnamese. My intent is to create a unified multilingual database for various purposes. I'm also interested in knowing if similar databases exist for indigenous Mexican languages that I can freely access."

(세션 로그, ChatGPT, 대화 “무료 다국어 사전”, 2025-12-03; 부록 A에 인용된 원본 파일.)

그 짧은 메시지 속 세 가지 요소는 이 프로젝트가 나중에 어떤 모습으로 발전하게 될지를 예고하고 있습니다. 첫째, 언급된 언어들—스페인어, 영어, 프랑스어, 이탈리아어, 포르투갈어, 그리고 나중에 추가된 일본어 — 는 저자가 번역가이자 언어 교사로 활동하며 실제로 구사하고 다루는 언어들이며(이 조합을 그는 나중에 “Core 6”로 공식화하게 된다), 여기에 중국어, 한국어, 베트남어까지 다음에 추가할 계획이었다. 둘째, “unified 다국어 데이터베이스”라는 문구 자체가 이미 목표를 명시하고 있다. 여섯 개의 사전이 아니라, 이 모든 것을 한데 모아 담은 단일 데이터베이스 말이다. 셋째, 저자는 첫날부터 indigenous Mexican languages에 대해 고민하고 있었으며, 이는 반복적으로 등장하는 주제입니다(Lingua Mundi를 위한 마야어 통합은 2026년 8월 [H]에서 탐구되었으며, 마야어 자료는 그의 연구 노트 전반에 걸쳐 등장합니다).

그 메시지의 배경도 중요합니다. 저자는 전문적으로 컴퓨터 과학을 전공한 사람은 아닙니다. 그는 번역가이자 어학 강사로, 당시 일본어를 본격적으로 배우고 있었으며, 그 학습을 더 쉽게 하기 위해 한자와 가나 학습 게임, 일본어 사전 파이프라인 같은 작은 도구들을 만들고 있었습니다(일본어 전자책을 위한 후리가나 편집기는 나중에, 2026년에 Shikibu 앱이 된 프로젝트로 추가되었다). 2025년 말 그의 홈 디렉토리에는 그 학습 과정의 흔적이 고스란히 남아 있다: 11 November 2025에서 다운로드한 KANJIDIC2 한자 사전 파일 사본, 12월에 다운로드한 조요 한자 목록, 그리고 — 12월 3일의 대화를 계기로 — 5 December[H]에서 다운로드한 Open Multilingual Wordnet 데이터 (파일 타임스탬프, /home/rex/; 부록 A 참조). 다시 말해, 12월 3일의 ChatGPT 대화는 전환점이 되었습니다. “내 도구를 위해 일본어 데이터가 필요하다”는 생각이 “내 모국의 언어를 포함해 다양한 언어를 아우르는 통합 다국어 데이터베이스를 무료로 구축하고 싶다”는 생각으로 확장된 바로 그 순간이었습니다.

1.2 From dictionaries to meanings: the December 2025 pipeline

저자가 그 다음에 무엇을 했는지는 그가 생성한 파일에서 확인할 수 있습니다. 2025년 12월 5일부터 12월 16일 사이에 그는 ChatGPT를 프로그래밍 파트너로 삼아 Python 스크립트로 구성된 작은 파이프라인 — extract_omw.py, merge_dicts.py, unified_dictionary_pipeline.py, crossref_deterministic.py —로 구성된 작은 파이프라인을 작성했는데, 이 파이프라인은 여러 오픈 소스에서 가져온 어휘 데이터를 다운로드하고, 구문 분석한 뒤 점차 더 구조화된 형태인 [H]로 병합하는 역할을 했다(스크립트 및 날짜 정보는 /home/rex/에 있음). 이 기간 동안의 가장 중요한 설계 결정은 파일 자체에 기록되어 있습니다. 12월 16일자로 작성된 파이프라인의 최종 단계는 모든 항목을 four kinds of objectsconcept, sense, lexemegrapheme(그래프렘은 한자 같은 문자)로 분할하여, 이를 JSON Lines 문서로 디스크에 기록합니다. 이 스키마는 다음과 같은 의미를 담고 있습니다: sense특정 사전에 수록된 특정 단어의 특정 의미이며, concept는 여러 언어에 걸쳐 여러 의미가 모두 가리키는 공통된 개념입니다. 또한 어휘의 concept_id 필드는 empty일 수 있는데, 이는 “이 단어의 의미가 아직 공유된 개념과 연결되지 않았다”는 뜻입니다. 해당 코드에 포함된 저자의 주석은 이 방법을 “제로 휴리스틱(zero heuristics)”이라고 설명합니다: 두 단어가 같은 의미를 가진다고 판단하기 위해 모호한 추측이나 통계적 유사성 기법을 사용하지 않으며, 오직 명시적이고 문서화된 연결만 허용합니다. [H] (파이프라인 코드 및 주석, /home/rex/, 2025년 12월; 자세한 내용은 부록 A 참조.)

그 12월 16일의 스키마는, 축소판으로 보면, 훗날 Lingua Mundi라고 불리게 될 프로젝트의 전체적인 구조를 담고 있습니다. 단어는 언어 속에 존재하고, 의미는 공유된 공간 속에 존재하며, 어떤 언어의 어떤 단어가 어떤 개념을 의미하는지에 대한 이 어렵고도 솔직한 문제는 결코 조작되지 않습니다. 개념과 연결되지 않은 의미는 데이터베이스에 연결되지 않은 상태로 명백히 저장되며, 조용히 추측하여 제자리에 채워 넣는 일은 없다. 10개월 후, 가져오기 파이프라인의 버그로 인해 영어 단어 cat가 해당 개념에 대해 보이지 않게 되었을 때, 저자는 이 원칙을 정확히 다음과 같은 표현으로 설명했습니다. 고아를 숨기는 것보다 보여주는 편이 낫다([H]; 7절 참조).

1.3 The gap, and the widening

Then the paper trail goes quiet for roughly five months — from mid-December 2025 until late May 2026, the available logs contain no dictionary-pipeline work [NV]. This is not unusual for a working translator with students to teach, but it is worth stating plainly: the project's growth was not continuous. It advanced in bursts, separated by weeks or months of other work — a rhythm that would continue throughout 2026.

스레드가 재개되면서 그 목표는 더욱 확대되었습니다. 1 May 2026에서 작성자는 “OMW v2.0 데이터 범위”(Open Multilingual Wordnet 릴리스)에 대해 연구하고 있다([H], 대화 제목 및 내용, ChatGPT, 2026-05-01). 27 May 2026에서는 “오픈 소스 언어 리소스”라는 제목의 대화를 시작하며, 사실상 다국어 지식 기반에 활용될 수 있는 모든 무료 어휘, 문법 및 의미론 리소스에 대한 체계적인 지도를 요청합니다 [H] (ChatGPT, 2026-05-27). 이제 이 프로젝트는 이름과 구체적인 형태를 갖추게 되었으며, 이에 대한 근거는 다음 장에서 확인할 수 있다.

1.4 Why this matters beyond one person's project

독자 여러분은 왜 논문에서 개인 프로젝트의 직관을 이토록 길게 기술해야 하는지 의아해할 수도 있습니다. 그 대답은 바로 그 직관 자체가 이 논문의 기여이기 때문입니다. 철자가 아닌 meanings가 다국어 데이터의 자연스러운 단위라는 생각은 학계에서 오랜 역사를 가지고 있습니다(이는 기계 번역의 “인터링구아” 전통에서 가장 오래된 꿈이자 Princeton WordNet의 신셋(synset)을 구성하는 원리이며; 2절 참조), 그러나 예산이 없는 개인이 이를 공공재로서 실천에 옮기는 경우는 드뭅니다. 이 원칙을 따르는 대부분의 다국어 자원 — Open Multilingual Wordnet, BabelNet, Universal Dependencies 프로젝트 — 는 연구비 지원을 받는 대학 컨소시엄에 의해 유지되고 있습니다. Lingua Mundi는 한 명의 독립 연구자가 오픈 데이터와 무료 도구만을 사용하여, 자신의 번역 및 교육 활동을 위해 그 인프라의 일부를 직접 구축하고, 이를 무료로 제공하려는 시도이다. 그 시도가 성공했는지는 독자 여러분이 본 논문의 나머지 부분에 제시된 증거를 통해 판단하실 수 있을 것입니다. 또한 저자의 저널을 살펴보면, 그가 줄곧 같은 질문을 같은 솔직함으로 던져왔음을 알 수 있습니다(4.3절 참조).

2 · Background: what "a map of meaning" means

Lingua Mundi가 무엇을 구축하고자 하는지, 그리고 그 프로젝트의 진정한 새로운 점이 무엇인지 이해하기 위해서는 세 가지 선행 연구가 중요합니다. 첫째, 의미가 철자와 분리될 수 있다는 언어학적 관점; 그러한 의미를 데이터로 저장하고 언어 간에 연결할 수 있다는 계산론적 관점; 그리고 구조화된 의미 지도가 신경 언어 모델과 경쟁하기보다는 상호 보완적 역할을 한다는 현대적 통찰입니다.

2.1 The sign and its two faces

현대 언어학은 겉보기에는 단순해 보이지만, 대개 20세기 초 페르디낭 드 소쉬르의 강의에서 유래한 것으로 여겨지는 다음과 같은 관찰에서 출발한다. 즉, 단어는 sound/shape(“기표”)와 concept(“ 기의”)의 쌍이다 (de Saussure, 1916/1983)의 결합이다. 이러한 관점에서 볼 때, 두 언어는 우연히 서로 번역되는 두 단어 집합이 아니라, signifieds라는 공유된 공간에서 부분적으로 겹치는 두 signifiers 집합이다. 영어의 표상 cat와 스페인어의 표상 gato는 서로 다른 형태이지만 같은 표지된 의미를 지닌다. 만약 기계가 표지되는 내용을 한 번 저장하고 그에 표지자를 연결할 수 있다면, 번역은 공유된 중간 영역을 통한 조회 과정이 될 것이다. 이는 기계 번역 분야에서 interlingua 접근법으로 알려진 개념이다. 즉, 영어→스페인어를 직접 번역하는 대신, 영어→의미→스페인어로 번역하는 방식이다.

인터링구아에 대한 꿈은 기계 번역 연구 분야에서 오랜 역사를 가지고 있지만, 완전한 일반성을 갖추기에는 너무 어렵다는 사실이 거듭 입증되어 왔습니다 (언어들은 의미를 똑같은 조각들로 나누지 않으며, 모든 번역가는 동물인 cat와 재즈 뮤지션인 cat가 하나의 기표에 얹혀진 서로 다른 지시물임을 알고 있다). 하지만 그 꿈은 결코 사라지지 않았으며, 단지 구현 가능한 범위로 좁혀졌을 뿐이다. 바로 어휘, 즉 안정적이고 공통된 의미에 가장 잘 대응하는 언어의 일부 말이다.

2.2 WordNet and the synset

The decisive narrowing came from psychology and lexicography. In the 1980s and 1990s, George Miller and colleagues at Princeton built WordNet, a lexical database for English organized not alphabetically but semantically (Miller, 1995; Fellbaum, 1998). WordNet's core invention is the synset (a contraction of "synonym set"): a group of words that can stand for the same meaning in some context. The synset {cat, true cat, Felis catus, domestic cat} is one meaning; the synset {cat, kat, guy, hombre} — meaning "an informal term for a youth or man" — is another, quite different meaning that happens to share the signifier cat. WordNet also records relations between synsets — most importantly the is-a hierarchy (hypernymy: a domestic cat is an feline, a feline is an carnivore, a carnivore is an* mammal…) — turning the dictionary into a graph, with meanings as nodes and typed relationships as edges.

WordNet가 Lingua Mundi에게 중요한 이유는 세 가지입니다. 첫째, 이는 의미별로 정리된 기계 판독 가능한 어휘집이 실현 가능하며 지극히 유용하다는 것을 입증했습니다. 현대의 검색 엔진, 맞춤법 검사기, 자연어 라이브러리들은 여전히 이에 의존하고 있습니다. 둘째, 이 프로젝트는 세상에 의미에 대한 안정적인 식별자 체계를 제공했습니다. Princeton WordNet는 시놉셋에 번호를 부여하므로, 02121620-n는 모호함 없이 “집고양이”를 의미하며 다양한 데이터베이스에서 인용될 수 있습니다. 셋째, 이는 다국어 프로젝트인 Open Multilingual Wordnet (OMW)의 기반이 되었습니다.

2.3 The Open Multilingual Wordnet: one meaning, many languages

프랜시스 본드(Francis Bond)와 라이언 포스터(Ryan Foster, Bond & Foster, 2013)가 시작한 OMW는 다양한 언어로 구축된 워드넷을 수집하여 프린스턴 영어 워드넷에 정렬합니다. 즉, 참여 언어마다 각 시놉셋에는 이에 대응하는 영어 시놉셋으로의 포인터가 포함됩니다. 그 결과, Lingua Mundi를 가능하게 한 자원이 탄생했습니다. 바로 “스페인어 gato(의미 1)는 영어 domestic-cat 시놉셋 02121620-n과 동일한 의미를 가진다”는 형식의, 사람이 직접 큐레이션한 명시적인 진술 모음입니다. Lingua Mundi의 저자가 2026년 7월 엔지니어링 사양서에서 이 프로젝트가 “시놉셋 중심”이 될 것이며 OMW [H](사양 문서, 2026년 7월 24일자)을 통해 언어를 정렬할 것이라고 기술했을 때, 그는 본드와 포스터의 업적 위에 서 있었던 셈입니다. 이는 OMW의 데이터 파일을 직접 파싱했던 그의 2025년 12월 파이프라인 스크립트에서도 이미 그러했듯이 말입니다.

2.4 The open-data ecosystem around the wordnets

OMW는 개인이 법적·기술적으로 결합할 수 있는, 공개 라이선스를 적용한 대규모 생태계 내의 하나의 노드입니다:

  • Wiktionary — 위키미디어에서 운영하는 공동 제작 사전

Foundation — 수백 개 언어에 걸쳐 매우 광범위한 어휘를 다루며, 정의, 번역, 어형 변화, 발음 등을 포함하여, 다음 항목 아래에 동일조건변경허락 라이선스 (Wikimedia Foundation; Meyer & Gurevych, [2012,는 전문가용 사전과의 경쟁적 가치에 대해 언급함).

  • Wikidata — 위키미디어의 구조화된 지식베이스 — 는 진술들을 저장합니다

기계 판독 가능한 식별자가 포함되어 있으며 CC0 (공공) 라이선스에 따라 공개됩니다. 도메인) (Vrandečić & Krötzsch, 2014).

100개 이상의 언어로 구성된 구문 분석 주석이 달린 문장 트리뱅크 오픈 라이선스가 적용된 언어(Nivre et al., 2020). UD가 기여합니다 실제 문장과 품사 정보 — 단어가 어떻게 사용되는지에 대한 증거 실제로 사용됩니다.

Jim Breen의 EDRDG 프로젝트에서 관리하며, 일본어를 다룹니다. 광범위하게, 그리고 여러 언어로 번역되어 있다 (Breen, 2004). 이것이 저자가 출발점으로 삼았던 것들입니다(그가 만든 최초의 사전 파일, 2025년 11월에 다운로드된 파일은 KANJIDIC2 [H]였습니다).

  • UniMorph — 굴절 형태론(단어)에 관한 다국어 저장소

(문법적 특징별로 분류된 run/ran/running와 같은 형식) (Kirov et al., 2018; McCarthy et al., 2020).

  • OPUS — 추출된 병렬 (번역된) 문장의 방대한 모음

웹과 영화 자막에서 가져온 것으로, 공개 라이선스(Tiedemann, 2012)가 적용되어 있습니다.

실제 코퍼스에서 얼마나 자주 등장하는지에 따라 단어를 분류합니다.

  • The ISO 639-3 standard는 모든 인간 언어에 안정적인

3글자 코드(예: 스페인어의 경우 spa, 일본어의 경우 jpn)를 유지함 작성자: SIL International — Lingua Mundi 데이터베이스는 이러한 코드를 language 테이블의 키로 사용합니다. [H].

이 생태계의 두 가지 특성은 전체 프로젝트의 구조를 형성하기 때문에 특히 강조할 필요가 있습니다. 첫째, 라이선스는 진정으로 개방형(허용형 또는 동일조건변경허락형)이므로, 출처 표기와 라이선스 조건이 준수되는 한 이를 결합하여 파생 데이터베이스를 만드는 것은 합법입니다(Lingua Mundi는 가져온 모든 데이터 세트의 출처와 라이선스를 자체 source 테이블에 기록합니다; 제6절 참조). 둘째, 이 생태계는 complementary입니다. Wiktionary는 폭은 넓지만 깊이가 얕고, 워드넷은 깊지만 범위가 좁으며, UD는 용법에 관한 것이고, UniMorph는 어형에 관한 것이며, 빈도 목록은 데이터의 중요도에 관한 것입니다. Lingua Mundi의 공학적 과제는 “데이터 찾기”가 아니라, “결합에 대해 거짓말을 하지 않으면서, 결합되도록 설계되지 않은 데이터를 병합하는 것”입니다.

2.5 Why a map of meaning still matters in the age of large models

합리적인 반론은 다음과 같이 명확히 제기되어야 합니다. 대규모 언어 모델이 이미 단어를 번역하고, 정의하며, 추론할 수 있다면, 애초에 왜 구조화된 어휘집을 만들어야 할까요? Lingua Mundi 저자가 2026년 6월 연구 논문(제3절)에서 제시하고 여름 동안 다듬은 답변은 세 부분으로 구성된다. 첫째, verifiability: 구조화된 데이터베이스는 그 작업 과정을 보여줄 수 있다 — 모든 링크에는 출처와 라이선스, 날짜가 명시되어 있다 — 반면 모델의 지식은 감사나 수정, 인용을 할 수 없는 불투명한 통계적 혼합물일 뿐이다. 둘째, cost and access: 로컬 데이터베이스에 대한 쿼리는 비용이 들지 않고 오프라인에서도 작동하는 반면, 모든 모델 쿼리는 에너지나 비용, 혹은 둘 다 소모한다. 저자의 일관된 설계 원칙은 “제로 토큰 연구 쿼리”이며, 이는 로컬 API is 연구 표면 [H] (프로젝트 노트, 2026년 8월 29일)를 사용한다. 셋째, complementarity: 2026년 6월 논문은 — 가설로서, 세 모델에 대한 감사 결과가 동일한 결론에 수렴한 점을 근거로 — 원시 토큰이 아닌 개념 식별자를 기반으로 작동하는 콤팩트한 모델이 정확히 개념 맵이 네트워크 외부에서 의미론적 작업을 수행하기 때문에 훨씬 더 효율적일 수 있다고 주장했다 (3절 참조). 그 가설이 실험을 통해 입증되든 아니든, 맵 자체는 모델에 여전히 유용하다. 재훈련 없이도 조회, 업데이트 및 인용이 가능한 외부 메모리로서 말이다.

따라서 Lingua Mundi의 지적 기원은 한 줄로 요약할 수 있다 한 문장으로 요약할 수 있다. 즉, 이는 인터링구아의 꿈이 WordNet에 의해 어휘 범위로 좁혀지고, OMW를 통해 다국어화되었으며, 오픈데이터 운동을 통해 합법화되었고, 한 번역가가 ‘언어’가 아닌 ‘의미’를 기록 대상으로 삼는 사전을 필요로 함으로써 개인화된 것이다.

3 · The name, the thesis, and the seven-graph architecture (May–June 2026)

3.1 Naming

2026년 5월 말 무렵, 저자의 노트와 사양서에는 작업 제목인 “다국어 어휘 플랫폼” [H]가 사용되었습니다(2026년 5월 23일자 마크다운 사양 마스터, /home/rex/Descargas/Phone backup/Download/). Lingua Mundi — 라틴어로 “세계의 언어”를 뜻함 — 는 1 June 2026에 남아 있는 기록 중 연구 원고의 제목으로 처음 등장한다(아래 참조 [H], 대화 기록, 2026년 6월 1일; 저자의 기록 보관소에서 확인된 가장 이른 등장 시점). 이 이름은 적절하다. 이 프로젝트가 주장하는 바는 수많은 언어를 포함하고 있다는 것이 아니라, about the one space of meaning 그 언어들이 공유하는 공통점이다.

3.2 A research thesis: meaning, not tokens

2026년 3월경부터 6월경까지 저자는 ChatGPT, Claude, DeepSeek과의 대화를 통해 언어의 개념 수준 지도가 어떻게 언어 기술을 획기적으로 더 효율적이고 접근하기 쉽게 만들 수 있는지에 대한 연구 논문을 구상했습니다. 이 논문은 저자가 대화에 제시한 작업적 틀(2026년 7월 18일자 타당성 검토 요청서에서 검토를 위해 설명을 붙여넣은 내용을 그대로 인용함) [H]:

"Create a multilingual, open, machine-readable map of human language that separates: 1. Meaning · 2. Form · 3. Structure · 4. History · 5. Usage — into interoperable graphs. The long-term objective is to make language computable at the concept level rather than the token level. […] Modern NLP largely models: token → token. Lingua Mundi models: concept ↔ language."

6월 원고에 명시된 근본적인 주장은, 언어 모델이 그 용량의 대부분을 surface variation에 할애하여 “dog”, "perro", "犬"을 서로 무관한 세 가지로 취급하는 데 용량의 대부분을 소모한다는 것이다. 그러나 이 세 단어는 사실 [H]라는 세 가지 표현을 가진 하나의 개념이다 (원고 V4, 2026년 6월 1일 감사 대화에서 전문 인용). 반면, 모델이 concept sequences를 읽고 쓸 수 있다면 — 개념 맵이 네트워크 외부에서 다국어 처리를 담당하는 방식 — 모델은 더 작고 저렴해지며, 일반 컴퓨터에서도 실행될 수 있을 것이다.

3.3 Seven versions in one morning: the adversarial-collaboration method

Lingua Mundi: 개념 기반 언어 모델을 위한 의미론적 인프라라는 제목의 이 논문은 seven-layer 아키텍처를 제안했는데, 이는 개념 그래프(언어에 독립적인 의미, 목표 규모 10억 노드), 신셋 그래프(모든 언어의 단어를 개념에 매핑), 그리고 형태론, 파생, 어원, 언어 간 상응 관계, 용법을 위한 그래프 — 이 모든 것이 공통 식별자 시스템으로 연결됨; 더불어 개념 기반 모델 아키텍처(Mamba 스타일의 시퀀스 모델이 개념 식별자를 읽는 Mamba 스타일 시퀀스 모델), 개념 그래프를 위한 쌍곡선(푸앵카레 볼) 임베딩, 사실에 대한 명시적 그래프 검색, 그리고 전체 시스템이 일반 노트북 [H]에 수용 가능함을 보여주는 검증된 리소스 예산 (원고, 2026년 6월 1일).

이 에피소드가 method로 주목받고, 유난히 잘 기록된 이유는 저자가 원고를 혼자 작성하지 않았기 때문입니다. 1 June 2026 날 아침, 그는 두 모델을 적대적으로 활용하여 7차례의 연속 수정 (V1–V7)를 거쳤는데, 이때 두 모델을 대립적으로 활용했습니다. DeepSeek이 각 수정본을 초안으로 작성하는 동안 ChatGPT는 적대적인 동료 심사자 [H]의 엄격함으로 각 초안을 검토했습니다 (대화 기록, DeepSeek "Lingua Mundi 프로젝트 검토 및 수정" 및 ChatGPT "감사 피드백 Lingua Mundi", 모두 2026년 6월 1일). 감사 기록은 원문 그대로 보존되어 있으며, 각 단계에서 어떤 부분이 수정되었는지에 대해 이례적으로 솔직하게 기술되어 있다:

  • INT8 임베딩 저장 공간에 대한 산술 계산이 수정되었습니다(계수가 틀린

(저장소 예산의 2배 오류);

  • 임의로 지어낸 경험적 주장(“경험적으로 볼 때, 우리는 …을 발견했다”)이 삭제되었고,

기존 연구에 근거를 둔, 명확하게 명명된 가설로 대체되었으며;

  • 가상의 미래 모델과의 비교는 다음으로 대체되었습니다.

실제 모델(DeepSeek-V3)과의 비교;

  • 초록에 제시된 성능 관련 주장은 점차 범위가 좁혀졌으며;
  • 근거 없는 확장성 주장은 ‘미해결 연구 과제’로 재분류되었으며; 그리고
  • V7에 의해 원고는 경험적 주장에서 정직한 주장으로 재구성되었다.

입장문 — 명백하고 반증 가능한 평가 기준을 갖춘 연구 계획 계획 (단어 의미 구분의 견고성, 제거 실험, 기준 모델).

로그에 기록된 감사 결과의 최종 평가는 원고의 vision에 대해 높은 점수를 준 반면, empirical support에 대해서는 일관되게 낮은 점수를 매겼으며, 마지막 감사의 최종 권고 사항은 [H]라는 직설적인 내용이었다:

"If I were advising the project, I would now pivot from paper-writing to implementation. The next valuable artifact is not V8. It is Lingua Mundi Prototype 0.1 … with: 100k–1M concepts, English only, concept tokenizer, concept reconstruction, TinyStories training run, direct comparison against token-Mamba. That experiment would answer the central question: does semantic compression preserve enough information to justify the bottleneck?"

저자는 그 조언을 따랐다. 이 에피소드에 대한 세 가지 관찰 사항은 이후의 모든 상황을 이해하는 데 중요하다. 첫째, idea는 결코 병목 요인이 아니었다 — 저자 자신의 말에 따르면, 그는 감사에서 A− 등급을 받은 비전을 가지고 있었으며; 진정한 병목 요인은 증거였으며, 감사 보고서는 이를 일곱 번이나 지적했다. 둘째, 저자의 작업 방식 — 여러 AI 모델을 대립적 협력자로 활용하고, 모든 초안과 모든 감사 결과를 보관하며, 과장된 주장보다는 정직한 과신에 기반한 과대 주장보다 솔직한 평가를 선호하는 것 — 이 스튜디오의 영구적인 표준이 되었으며, 이는 본 논문의 [H]/[O]/[NV] 검증 규약(부록 A)에서도 확인할 수 있는 동일한 방법이다. 셋째, 그 6월 원고의 7계층 아키텍처는 저자가 구현 단계로 전환했을 때 사라지지 않았으며, 프로젝트의 roadmap가 되었다. 현재(2026년 9월) 존재하는 Lingua Mundi는 개념 그래프, 시놉셋 그래프, 형태소 분석 가져오기, 코퍼스 계층 및 API를 구현하고 있으며; 파생, 어원, 상응, 용법 계층은 동일한 계획(제5–6절, 10.3절)인 [H](프로젝트 로드맵, 2026년 8월 29일)의 명시적으로 예정된 단계들이다.

4 · The platform takes shape (July–August 2026)

4.1 Feasibility: "can this be done with open-source components?"

On 18 July 2026 the author asked ChatGPT, point-blank, whether the vision could be built from existing free components and what he would need to develop it [H] (conversation "Lingua Mundi Project Feasibility", 2026-07-18, 00:44 UTC — the evening of 17 July in the author's Central Time zone). The conversation — and the weeks that followed — record the pivot from research paper to engineering program. The project adopted the formal mission statement he pasted into that conversation for review (quoted in Section 3.2), and the author began scaffolding actual code: schema files for the data model exist on disk dated 17 July 2026 [H] (code snapshots, July 2026; see Appendix A).

4.2 The engineering specification (24 July 2026)

24 July 2026에서 저자는 이 설계를 104페이지 분량의 엔지니어링 사양서인 다국어 어휘 플랫폼 — 엔지니어링 사양서, 버전 2.0으로 정리하였으며, 부제는 “개정 및 생산 준비 완료”입니다. [H] (PDF, /home/rex/, 2026년 7월 24일; 본 논문을 위해 텍스트를 발췌함). 이 사양서는 프로젝트의 헌장이며, 그 내용은 이후 구축된 대부분의 사항을 설명하고 있다:

  • The synset-centric principle. 이 문서에 따르면, 모든 어휘적

객체는 궁극적으로 synset(의미)에 연결되어야 하며, 또한 데이터베이스는 철자보다는 의미를 중심으로 구성되어 있습니다. 이 방식은 효과가 있었습니다. 예를 들어, ‘bank’라는 단어는 여러 개의 표면 형태를 가진 하나의 표면 형태여야 합니다. 서로 다른 시놉셋 (“강둑”, “금융 기관”, “~에 의지하다”) "무언가") — 결코 [H]와 같은 구분되지 않은 의미의 덩어리가 아니다.

  • Language tiers. 이 사양은 언어를 두 단계로 구분하여 계획하고 있습니다:

출시 시 지원 언어(Tier 1) — 영어, 스페인어, 프랑스어, 포르투갈어, 일본어, 그리고 중국어(간체자 및 번체자) — 그리고 2단계 — 이탈리아어, 한국어, 그리고 베트남어 [H]. (실제로 출하된 세트는 이 데이터베이스는 제10절에 설명된 바와 같이 두 가지 흥미로운 측면에서 차이가 있는데, 바로 다음과 같습니다: 지원되는 6개 언어는 영어, 스페인어, 프랑스어, 독일어, 포르투갈어, 일본어입니다 — 중국어와 이탈리아어는 없고, 독일어는 있습니다. 대체 내용은 다음과 같습니다. 현존하는 기록 [NV] 어디에도 설명되어 있지 않은, 다음과 같은 솔직한 인정: (출처에 대한 미해결 문제.)

  • The data model. 이 사양서의 제5장에서는 스키마를 개략적으로 설명합니다.

대략적으로 말하자면, 리포지토리의 첫 번째 마이그레이션에 포함된 모델은 다음과 같습니다. 11개의 테이블로 구성된 핵심 부분이 다음과 일치하는 2025년 12월 시제품의 4개 실체에 대한 직관이 이제 공식화되었습니다: 언어, 어소, 의미, 개념(synset), 관계, 출처, 신셋(synsets) 및 보조 표(5절 참조).

  • A five-level alignment hierarchy. 자동 및 수동 연결 기능 때문

단어와 개념 간의 연관성은 신뢰도 면에서 차이가 있으므로, 제안된 사양은 출처가 명시적으로 밝힌 링크를 기준으로 한 5단계의 일치 신뢰도 (예: OMW 매핑)부터 휴리스틱 추측에 이르기까지 — 각 저장된 링크에는 신뢰도가 함께 포함됩니다. 이는 다음의 완성된 형태입니다. 2025년 12월 “제로 휴리스틱” 규칙: no 자동 연결이 아니라, labeled, honest[H]와 연결됩니다.

  • A phase roadmap with gates.의 0~5단계, 각 단계마다 종료 기준이 있으며,

스키마와 ETL부터 API, 애플리케이션에 이르기까지.

  • A risk register — 어원 제안을 담은 자기비판 부록 포함

그리고 CJKV/Unihan 레이어 및 일본어와 중국어의 ‘가짜 친구’에 대한 주의 사항 (예: 일본어의 ‘娘’(딸) 대 중국어의 ‘母亲’(어머니); ‘手紙’(편지) 대 "화장지") [H].

이 사양서에는 프로젝트가 나중에 단순화하게 될 스택도 명시되어 있었다: FastAPI, PostgreSQL, 검색 엔진(사양서상 Meilisearch), 그리고 웹 프론트엔드(Next.js). 특히, 8월 13일이 되자 저자 자신도 이미 그 스택에 의문을 제기하고 있었다(4.4절).

4.3 The July journal: thinking about the semantic operating system

거의 같은 시기에, 저자의 개인 일지 (knowledge project.txt, 85 KB, 본 논문을 위해 전문을 열람함; 파일 타임스탬프 2026년 7월 18일, 단일 작업 세션)에는 이와 관련되면서도 좀 더 개인적인 내용이 기록되어 있다. 바로 “보편적 의미 그래프” — 프로그래밍 언어, 음악 이론, 화학, 그리고 자연어 전반에 걸쳐 작동할 수 있는 표기법 독립적인 의미 표현 방식 (그가 USG라고 명명한 별도의 프로젝트)에 대한 고찰 [H] (일기, 2026년 7월). 이 저널에서 ‘링구아 문디(Lingua Mundi)’와 가장 관련이 깊은 구절(2563– 2587행)은 one semantic object를 세 가지 언어로 동시에 표현하는 것이 무엇을 의미하는지에 대한 그의 성찰이다. 이는 cat · gato · 猫와 동일한 직관으로, 언어보다는 인터페이스에 대한 사고 훈련의 일환으로 작성된 [H]. 의미심장하게도, 저널에서 설명하려는 “언어”의 실제 예시는 설명해야 할 “언어”에 대한 예시는 Lingua Mundi 코드베이스의 LanguageCreate 스키마인데, 이는 7월 중순 무렵 이미 두 가지 흐름(연구 비전과 실제 코드)이 그의 머릿속에서 [H]로 이미 하나로 엮여 있었다는 증거이다.

4.4 August: from schema to running system

2026년 8월, Lingua Mundi가 system로 바뀌었습니다. 남아 있는 로그 기록에는 밀집된 일련의 결정들이 나타나며, 각 결정은 그 흔적을 남기고 있습니다:

  • 1–8 August. 저자는 그래프와 지식 표현을 탐구했다.

옵션 (“그래프로 본 JSON”, 7월 29일; API 수익화 아이디어, 8월 7일~12일) 그리고 — 최종 아키텍처에 있어 결정적인 요소인 — API가 [H]는 (4.5절)에서 설명한 대로 ‘반드시’ 무거운 스택이 필요합니다.

  • 11 August. 그는 Maya languages를 링구아에 통합하는 방안을 모색했다.

Mundi(“Lingua Mundi 마야 통합”)는 이에 대한 관심을 이어가며 2025년 12월 메시지 [H]에서 처음으로 언급된 멕시코 원주민 언어들.

  • 13 August. 두 차례의 디자인 논의를 통해 그 형태가 결정되었다.

제품: "Linguistic API 기술 스택"(4.5항 참조) 및 "의미론적 상호작용" 'Layer'는 지식 계층 간의 미래 인터페이스를 구상한 것으로, 및 애플리케이션 [H].

  • 19–25 August. 그는 Japanese demonstration를 만들었습니다: 소형

오프라인 데이터베이스(SQLite)에 일본어 사전 데이터를 묶어두어 개념 중심의 디자인은 직접 만져보고, 질문해 볼 수 있으며, 다른 사람들에게 보여줄 수도 있다 ("일본어 데모 만들기"; 생성된 lingua-mundi-jpn.sqlite 파일은 (디스크에 저장됨) [H]. 이 스프린트에는 구체적인 마감 기한이 있었고 참석자: Japan Foundation 측 대표들이 그의 사무실에 도착할 예정이었는데 다음 주에 대학에서, 그리고 데모(후리가나와 함께 (같은 시기에 Shikibu로 이름이 변경되던 편집기)는 다음과 같이 준비되었으며 해당 방문([H])에 대한 사후 제출용 제품 서류(대화 기록, (2026년 8월 19일–25일).

  • 23 August.는 그 개념에 대해 한 문단으로 설명해 달라는 요청을 받고, 그는

로그에 기록된 내용과 일치하는 요약본을 받아보았습니다: "a 인간 언어를 위한 기계 판독 가능한 언어 인프라… 오히려 Lingua Mundi는 단순한 일본어 사전이나 번역 앱을 넘어 "일반 언어 지능 레이어가 되는 것을 목표로 한다" [H] — 그리고 같은 대화에서, [technical]에 대한 설명에서 [이름]을 언급하며 당시 계획된 스택 (PostgreSQL, 그래프 쿼리의 경우 Apache AGE, OpenSearch 조회를 위해, FastAPI(API)를 사용하여 다음 달의 측정값을 이로 인해 (4.5절, 6절) [H]는 불필요해질 것입니다.

  • 24 August onward. 코드베이스가 다음과 같이 영구적인 위치로 이전되었습니다.

매일 생성되는 GitHub 백업 스냅샷이 포함된 적절한 저장소("LinguaMundi") 8월 27일부터 시작되는 트레일 [H] (저장소 스냅샷; 부록 A 참조).

4.5 The lean-stack decision that shaped everything

8월에 내려진 가장 중대한 기술적 결정은 그대로 보존되어 있습니다. 13 August 2026에 작성자는 자신이 계획한 기술 스택 — FastAPI, Polars, DuckDB, PostgreSQL, Apache AGE(그래프 확장 기능), OpenSearch, Redis, Celery, React, Docker —를 게시하고 다음과 같이 물었습니다. “이미 Postgres에서 실행되고 있는 언어학 기반 API에 이 스택이 정말 필요한가요?” [H] (대화 “언어학용 API 기술 스택”, 2026년 8월 13일).

그가 받은 — 그리고 받아들인 — 대답은, 아직 그 중 거의 아무것도 필요하지 않다는 것이었다 : PostgreSQL만으로도 관계형 사전 데이터, 한자, 읽는 법, 활용형, 번역,全文 검색, 심지어 그래프 스타일의 재귀 쿼리까지 처리할 수 있으며, 올바른 원칙은 “PostgreSQL의 한계 → 기술 추가”이지, “3단계에서 그래프 데이터베이스를 명시했으니 → 그래프 데이터베이스 설치”가 아니라는 것이었다 [H] (같은 대화). 그 조언은 다음과 같이 결론지었다. “당신의 API의 경쟁 우위는 인프라가 아닙니다. 데이터 위에 구축한 언어 데이터 모델과 변환 기능에 있습니다” [H].

이 결정 — 관계형 데이터베이스 하나, API 프레임워크 하나, 그리고 필요성이 입증될 때까지는 그 외에는 아무것도 사용하지 않기로 한 — 은 제6~7절에서 설명된 성능 아키텍처의 직접적인 기원이 됩니다. 2026년 9월, 데이터베이스가 160만 개의 단어 의미로 늘어났고 단순 쿼리 처리 시간이 몇 분으로 늘어났을 때, 저자는 그래프 데이터베이스나 검색 엔진을 선택하지 않았다: PostgreSQL materialized views, 즉 “다시 도출하지 말고 구워내라”는 패턴을 채택하여, 2014년형 하드웨어에서 가장 느린 쿼리 실행 시간을 1분 이상에서 약 1초로 단축했다(제7절). 8월에 가벼운 구조를 유지하기로 한 결정 덕분에 9월의 최적화가 필요해졌을 뿐만 아니라 실현 가능하게 되었습니다.

4.6 The human-AI development method, in practice

이 역사를 읽는 독자라면 거의 모든 중요한 사건마다 대화 기록이 함께 수반된다는 사실을 눈치챘을 것이다. 저자는 대화를 통해 사고를 전개하기 때문이다. 2026년 8월이 되자 그의 방법은 기록을 통해 정확히 묘사될 수 있는 형태로 정착되었다:

  1. The human sets the direction and owns the data. 의 모든 요청은

로그 파일은 저자 본인의 것이며, 모든 파일은 저자의 컴퓨터에 저장되어 있고, 모든 결정은 — ‘린-스택’ 문제와 같은 반전 상황을 포함해 — 모두 그의 몫이다.

  1. AI models are used as specialized collaborators. ChatGPT를 사용했습니다

연구, 건축 비평 및 감사에 주로 활용되며; DeepSeek는 작성 및 수정 주기, 그리고 (나중에) 그 기반이 되는 하네스로서 스튜디오 자체 자동화 시스템; 장기적 관점의 메모리 및 프로젝트 관리를 위한 ‘클로드’ 컨텍스트 (이 스튜디오의 지식 기반은 클로드의 메모리 내보내기 파일에서 시작되었다).

  1. The record is kept. 대화 내용이 내보내집니다 (작성자의 아카이브)

(수천 개가 포함됨), 코드의 스냅샷이 생성되며, 2026년 8월 26일부터는 매 작업 세션은 Obsidian 지식베이스에 다음과 같이 기록됩니다. 서두, 날짜 및 검증 상태(제9절). 본 논문은 바로 그 기록 관리 습관 덕분에 가능했던 일입니다.

  1. Adversarial review is built in. 6월 원고의 V1–V7 감사

loop(3.3절)이 관행으로 자리 잡았는데, 초안은 다음에 의해 검토됩니다. 이를 작성한 모델과는 다른 모델이며, 감사 기록은 파일.

이를 “바이브 코딩”이라 부르든, “AI 지원 개발”이라 부르든, 아니면 단순히 “도구 활용”이라 부르든, 기록을 위해 정확한 명칭을 밝히는 것이 중요합니다: Lingua Mundi 는 AI 어시스턴트와의 의도적이고 문서화된 협업을 통해 인간이 주도하여 구축한 프로젝트이며, 이 논문(서두의 공지사항에 따라 저자의 지시에 따라 AI가 생성한 초안) 역시 동일한 방법론의 산물입니다.

5 · Design: the linguistic and mathematical principles of the model

이 섹션에서는 Lingua Mundi가 언어를 저장하는 방식을 결정하는 개념을 알기 쉽게 설명합니다. history를 알고 싶은 독자는 6절로 건너뛸 수 있으며, formulas and schema를 알고 싶은 독자는 이 섹션과 부록 A에서 해당 내용을 확인할 수 있습니다.

5.1 Four kinds of objects, one space of meanings

이 데이터 모델은 2025년 12월 파이프라인의 4가지 엔티티 유형(1.2절)과 2026년 7월 사양의 11개 테이블 [H]에서 직접 파생됩니다. 완성된 형태에서는 5가지 핵심 유형의 데이터를 저장하며 (2026년 9월 [H] 라이브 스키마에 따라 검증됨):

  • Language — 각 인간 언어당 한 행씩, ISO 639-3 코드를 기준으로 정렬됨

3글자 코드(eng, spa, jpn, …)와 그 이름, 자체명(the (화자들이 사용하는 이름), 언어군, 문자 체계. 다음 내용을 추가: 전체 시스템에 언어를 추가하는 것은 설계상 한 행을 추가하고 데이터셋을 추가하는 방식입니다: 어별 테이블은 어디에도 없습니다 [H] (코드 및 프로젝트 참고 사항, (2026년 8월 29일). 이러한 “언어에 구애받지 않는” 특성은 스키마 수준에서 인터링구아 개념의 표현 (2.1절).

  • Lexeme — 특정 언어의 단어 형태: 문자열 cat,

문자열 gato, 문자열 . 하나의 어휘소는 정확히 하나의 언어에 속한다 그리고 품사를 나타냅니다.

  • Senseone meaning of one lexeme as recorded by one dictionary:

WordNet에서 유래한 ‘cat’의 동물적 의미, 그리고 WordNet는 Wiktionary에서 유래한 ‘cat’의 ‘윷로그’ 의미를 가집니다. 어휘 단위는 일반적으로 여러 가지 의미 — 이 모델은 polysemy를 다음과 같이 표현합니다(한 단어, (여러 가지 의미)를 지니면서도 그 의미들이 서로 뒤섞이지는 않습니다. 어떤 의미는 있을 수도 있고 없을 수도 있으며 아직 어떤 개념과도 연결되어 있지 않을 수 있습니다. 이 연결은 concept_id 필드이며, 그리고 그 결과는 nullable by design입니다. 연결되지 않은 의미는 유지되며 다음과 같이 표시됩니다. [H](스키마; 파이프라인 메모, (2025년 12월).

  • Concept — 여러 언어에 걸쳐 공통적으로 나타나는 의미: 그 개념

Princeton WordNet 시놉셋 URI로 식별되는 “집고양이” princeton-wordnet:02121620-n [H] (실시간 데이터베이스). 개념은 어디에 있는지 다국어 대조 작업이 이루어집니다: 스페인어 gato (이 단어의 의미 중 하나), 영어 cat, 프랑스어 chat, 독일어 Katze, 일본어 는 모두 같은 개념을 가리키고 있습니다 — 이름은 다양하지만 모두 ‘별 하나’입니다 (제8절). 개념 테이블은 시스템의 핵심이며, 이 현재 데이터베이스에는 96,434개의 행이 저장되어 있습니다. [H] (측정, 9월 6일~7일) (2026).

  • Relation — 두 개념 간의 유형이 지정된 유향 연결,

예: 집고양이 IS_A(고양이), 또는 고양이 IS_A(육식동물). 관계 술어, 신뢰도 및 출처를 포함합니다. 현재 데이터베이스에는 그 중 171,672개는 [H]입니다 (측정일: 2026년 9월 6일~7일).

이 다섯 가지 주변에는 출처 관리 시스템이 자리 잡고 있습니다. 여기에는 모든 데이터 세트의 출처, 라이선스, URL을 기록하는 source 테이블(이를 통해 데이터베이스 내의 어떤 주장도 출처가 명시되지 않은 채로 남는 일이 없도록 함), OMW 형식과 연동되는 시놉셋 테이블, 그리고 한자와 읽기를 위한 보조 테이블인 [H]가 포함됩니다 (스키마, 2026년 9월).

5.2 The alignment problem, and why it is not faked

The central intellectual problem of a multilingual map of meaning is alignment: deciding that this sense of this word in this language is the same meaning as that sense of that word in that language. Lingua Mundi's answer, inherited from the OMW design, is to not decide it fresh: the OMW already states, per language, which of its synsets correspond to Princeton WordNet synsets, so the database imports those explicit mappings as its primary alignment layer [H] (Bond & Foster, 2013; import code). Where no explicit mapping exists, the system applies its five-level confidence hierarchy (from the July 2026 specification): explicit source-stated links rank highest; inferred links rank lowest and are stored with their level — never silently promoted to "fact" [H] (specification, 24 July 2026). This is the mature form of the December rule the author scribbled in his pipeline code: "zero heuristics." It is not that the system never guesses; it is that guesses are labeled as guesses, which is what makes the database honest enough to grow: a wrong guess that is marked as a guess can be found and fixed; a wrong guess stored as fact poisons everything downstream.

언어의 세분화 기준에도 동일한 철학이 적용됩니다. ISO 639-3은 정치적 경계나 문자 체계의 변형이 아닌, 실제 언어를 구분합니다. 저자는 향후 해결해야 할 진정으로 까다로운 사례 하나를 지적했습니다. 바로 한국어입니다. 한국어의 단일 ISO 코드인 kor는 대한민국 표준과 조선민주주의인민공화국 표준을 모두 포괄합니다. 현존하는 기록에 따르면, 이는 미결정 모델링 사항인 [H]로 표시되어 있습니다 (2026년 9월 7일 회의록)로 표시된 채 남아 있습니다. 이는 스키마가 로케일이 아닌 languages를 저장한다는 원칙을 보여주는 사례이자, 실제 언어 데이터가 ‘언어당 한 행’이라는 깔끔한 틀에 얽매이지 않는다는 점을 상기시켜 줍니다.

5.3 The graph: taxonomies, neighborhoods, and the long tail

Once senses are aligned to concepts and relations connect concepts, the database is a graph: 96,434 meaning-nodes joined by 171,672 typed edges, the largest component being the is-a taxonomy inherited from WordNet (mammal → carnivore → feline → domestic cat), enriched by instance-of, part-of, and cross-language relations [H] (measurement, September 2026; schema). Three mathematical facts about such graphs shape the user interface and the engineering:

  1. Taxonomies are trees of meaning. 모든 개념의 상위 개념은

알려진 바와 같이, 이 시스템은 “이건 어떤 종류인가?”(오르다)라는 질문에 답할 수 있으며, "이것에는 어떤 종류가 있나요?" (아래로 내려가다) — 그 이면에 있는 연산들은 인터페이스의 분류 렌즈(제8절).

  1. Degree distributions are Zipfian. 실제 언어 그래프는 다음과 같습니다.

scale-free-ish: “동물”, “사람”, “사물”과 같은 몇 가지 개념은 대부분의 개념은 이웃이 몇 개에 불과한 반면, 이 개념은 방대한 규모의 이웃 집단을 가지고 있다. 이 “롱테일”은 Zipf가 유명한 연구를 통해 측정했던 것과 동일한 통계적 분포 형태입니다. 단어 빈도 (Zipf, 1949): 소수의 단어가 전체의 대부분을 차지한다 사용법. 이로 인해 두 가지 설계상의 결과가 도출됩니다: 순위 지정 기능이 반드시 있어야 합니다(다음과 같이 할 수는 없습니다). (하나의 검색어에 대해 30,000개의 의미를 표시하며), 순위는 meaningful여야 합니다 — 따라서 이 인터페이스는 개념들을 sky brightness 순으로 정렬하며, a 어떤 의미가 얼마나 “중요”하거나 다른 의미들과 얼마나 밀접하게 연결되어 있는지를 나타내는 지표(5.5절).

  1. Shortest paths are the natural translation route. 두 개념이 주어졌을 때,

그래프에서 연결 경로를 검색할 수 있습니다 — 이 작업의 원리는 다음과 같습니다. 인터페이스의 육분계 도구(8.4절)는 유한한 분류 체계에 대한 양방향 폭우선 탐색 (≤ 10 홉, (노드당 이웃 25개, 응답 시간 밀리초 단위) [H] (코드, 라이브 측정, 2026년 9월).

5.4 Zipf and the shape of dictionaries

Schematic Zipfian long tail: the head is baked, the tail stays relationalthe headfew words, most usage —baked into ranking viewsthe long tailrare words stay in therelational tablesschematic — Zipf's law: frequency ∝ 1/rank (Zipf, 1949)
Schematic only — it illustrates the design consequence of Zipf's law described in Section 5.4.

Zipf의 법칙은 전체 성능 아키텍처를 은연중에 설명해 주기 때문에 특별히 언급할 가치가 있습니다. 단어 빈도가 멱법을 따른다면, 어떤 사전이든 흔한 단어로 구성된 짧은 ‘헤드’와 극히 드문 단어들로 이루어진 천문학적으로 긴 ‘테일’이 주를 이룹니다. 2026년 6월 원고에서는 심지어 개념 어휘 [H]에 대한 Zipf 기반의 커버리지 계산식까지 도출해 냈습니다 (원고 V7 감사, 2026년 6월 1일). 데이터베이스에서 긴 꼬리는 다음과 같은 의미를 가집니다. 대부분의 rows는 희귀 단어이고, 대부분의 queries는 흔한 단어에 해당하며, 모든 희귀 단어를 포함한 전체 테이블을 스캔해야 하는 어떤 쿼리도 미리 계산된 순위 목록에서 시작할 수 있는 쿼리보다 비교할 수 없을 정도로 느립니다. 제7절의 구체화된 뷰(materialized-view) 패턴은 근본적으로 Zipf의 법칙을 성능의 적에서 설계 도구로 전환하는 방법입니다. 즉, head(순위, 개념별 상위 단어)를 한 번만 생성해 두고, 실제로 필요한 드문 조회 시에는 tail가 관계형 테이블에 남아 있도록 하는 것입니다.

5.5 Sky brightness: one ranking to rule the map

이 인터페이스의 구성 은유는 star map(섹션 8)이며, 이 은유는 실제 계산에 기반을 두고 있습니다. 각 개념에는 brightness — 하늘을 분류하는 데 사용되는 수치적 규모 — 가 할당되는데, 이는 다국어 그래프 내에서의 위치, 즉 해당 개념에 단어가 연결된 언어의 수, 해당 단어 집합의 풍부함, 그리고 분류 체계 내에서 그 개념이 차지하는 중요도에 따라 도출됩니다. 데이터베이스는 이를 concept_sky_rank로 구체화하는데, 이는 96,000개 이상의 모든 개념에 대해 미리 계산된 정렬 순서이므로, “하늘을 보여줘” 와 같은 요청 시 백만 행을 정렬할 필요가 없도록 [H] (스크립트 및 측정, 2026년 9월 6일). 두 가지 보조 뷰인 concept_lang_rank (언어별 순위)와 concept_word_rank(언어별 개념당 상위 4개 단어, 별에 해당 단어를 풍부하게 부여하는 작업이 160만 개 이상의 의미에 대한 조인이 아닌 단순 조회로 이루어지도록 “사전 처리”됨) — 이 두 가지 보조 뷰가 순위 시스템을 완성하며 [H](스크립트, 2026년 9월 6일; 행 수는 부록 A 참조)를 완성합니다.

5.6 Bounded work: the game-designer's discipline applied to a database

마지막 설계 원칙은 비디오 게임에서 차용한 것입니다. 게임은 세계가 아무리 넓어도 16밀리초 만에 한 프레임을 렌더링합니다. 즉, 프레임당 작업량을 할당하는 방식입니다. Lingua Mundi도 동일한 원칙, 즉 무한한 데이터 공간에서 쿼리당 작업량을 제한하는 방식을 적용합니다. 이는 하드웨어 사양이 이를 요구하기 때문입니다 ( 2014년형 노트북; 9절). 어떤 요청도 전체 코퍼스를 스캔할 수 없으며, 모든 요청은 인덱스나 미리 생성된 뷰에서 시작해야 합니다. 인터페이스는 사용자가 무언가를 수행할 때만 렌더링되어야 하며(CPU 유휴 시간 ≈ 0%), 결과는 안정적인 윈도우 단위로 페이징됩니다. 제6장과 제7장에서는 이 원칙이 직면한 세 가지 성능 장벽과, 각각을 동일한 패턴인 사전 생성(bake), 재파생 금지(don't re-derive)로 어떻게 해결했는지 보여줍니다.

6 · Architecture: importing the world, serving the map

6.1 The pipeline: one registry, twenty-plus importers

모든 데이터셋은 importer를 통해 Lingua Mundi로 입력되는데, importer는 하나의 외부 형식을 읽어 표준 스키마로 변환하는 방법을 알고 있는 프로그램입니다. 수입기에 대한 유일한 공식 목록은 ‘수입기 레지스트리’라는 단일 파일에 저장되어 있으며, 2026년 9월 기준으로 이 파일에는 다음을 다루는 20개 이상의 등록된 플러그인이 포함되어 있었습니다: Princeton WordNet와 영어 WordNet, Open Multilingual Wordnet (OMW), Wiktionary 및 그 기계 판독 가능 파생 형식인 kaikki, Wikidata, UniMorph 및 J-UniMorph(형태론), Universal Dependencies 트리뱅크(UD), OpenThesaurus(독일어 동의어), CMU 발음 사전,, IDS character decompositions, CLICS 다언어 데이터, 단어 빈도 목록, 일본어 계열 — JMdict, EJDict, KANJIDIC2 [H] (임포터 레지스트리 및 프로젝트 노트, 2026년 9월 6–7일 확인). (정확성을 위한 한 가지 주의 사항: 임포터 디렉토리에 OPUS 병렬 코퍼스용 폴더가 존재하지만, 이는 로드맵의 문장 계층을 기다리고 있는 비어 있고 등록되지 않은 스텁입니다. 이 항목은 정직성을 위해 여기에 나열된 것이며, 출시된 소스 [H] (코드 목록, 2026년 9월 6–7일).) 각 임포터는 동일한 ISO 코드를 기준으로 대상 언어를 등록하며, 이는 스키마가 이론적으로뿐만 아니라 실제 적용에서도 언어에 구애받지 않게 하는 요소입니다. [H] (코드).

가져오기 작업은 각 소스를 실행하고, 가져오기 작업을 기록하며, — 제7절에서 특히 중요한 점으로 — 성공 여부를 보고하는 파이프라인을 통해 관리됩니다. 각 가져오기가 완료된 후, 이 파이프라인은 순위 보기(5.5절)를 갱신하여 “하늘”이 항상 가장 최신 데이터를 반영하도록 합니다 [H] (스크립트, 2026년 9월).

6.2 The corpus today (measured)

Lexemes per live language (rounded, September 2026 audit)Japanese · jpn345k lexemesEnglish · eng271k lexemesGerman · deu176k lexemesSpanish · spa152k lexemesFrench · fra149k lexemesPortuguese · por145k lexemeslexemes in thousands (enrichment audit, rounded — Section 6.2)
Lexemes per live language (enrichment audit, 6 September 2026; rounded). Full SQL counts in Section 6.2.

2026년 9월 6일 23:02(중부 표준시)에 활성 데이터베이스에 대한 SQL 직접 측정, 2026년 9월 7일 재확인됨(두 측정값 모두 동일) [H]:

TableRows
concepts (meanings)96,434
lexemes (word forms)1,238,383
senses (word-dictionary meanings)1,608,018
relations (typed concept links)171,672
languages (live)6 — eng, spa, fra, deu, por, jpn

언어별 어휘 가중치 (어휘 풍부도 감사, 2026년 9월 6일 [H]):

LanguageLexemesSenses
Japanese (jpn)≈ 345,000≈ 528,000
English (eng)≈ 271,000≈ 393,000
German (deu)≈ 176,000≈ 203,000
Spanish (spa)≈ 152,000≈ 167,000
French (fra)≈ 149,000≈ 157,000
Portuguese (por)≈ 145,000≈ 160,000

이 수치들에 대해 두 가지 솔직한 주의 사항을 덧붙여야 합니다. 첫째, 언어별 수치는 대략적인 값입니다(감사 결과에서 반올림한 값); 표 단위의 SQL 개수는 측정 시점 기준 정확한 수치입니다. 둘째, 코퍼스는 layered입니다: 일부 데이터셋(모든 Wiktionary 및 단어 빈도 목록)은 의도적으로 가져오기 실행당 50,000행으로 제한되었으며, 더 광범위한 범위는 다른 출처에서 제공됩니다. 또한 이 제한은 숨겨진 [H]가 아닌 문서화된 사항입니다(감사 보고서, 2026년 6 2026년 9월 6일). 제7절에서는 유사한 제한이 not 위험 요소로 문서화되었을 때 어떤 일이 발생하는지 보여줍니다.

6.3 The API surface

이 시스템은 의도적으로 동결된 소규모 HTTP API(FastAPI)를 노출하며, 이 시스템의 Phase-0 노출 영역은 새로운 단계가 도입되더라도 절대 중단되지 않는 것으로 문서화되어 있습니다 [H] (프로젝트 노트, 2026년 8월 29일). 2026년 9월 [H]에 실시간으로 검증된 엔드포인트는 다음과 같습니다:

  • /languages — 현재 사용 중인 언어와 해당 메타데이터를 나열합니다;
  • /lexemes/concepts — 페이지별 목록 쿼리 (limit/offset, capped)

(8월~9월 감사 결과 제본이 되어 있지 않은 것으로 확인된 후, 페이지당 1,000으로 책정됨);

  • /analyze — 단어의 형태론적/어휘적 분석;
  • /kanji/lookup — 일본어 한자 및 사전 검색;
  • /graph/sky — 별자리 지도 피드: 하늘의 밝기 순으로 정렬된 개념들,

검색 매개변수(query, lang), 깊이(skip/계층), 여부 구성원 단어(words)를 연결하고, taxonomy lens(anchor, (lens=up|down)는 주어진 위치에서 is-a 트리를 올라가거나 내려가는 개념;

  • /graph/star/{id} — 한 별을 완전히 살펴보면: 언어별 구성 단어 수와

이 개념과 관련된 개념들, 둘 다 페이지로 나뉘어 있음;

  • /graph/path — 두 점 사이의 유계 그래프 탐색(5.3절)

개념;

  • /graph/word — “단어 렌즈”: 주어진 단어와 언어를 바탕으로, 개념들은

현재 그 감각들이 연결되어 있는 대상.

모든 응답은 압축(gzip)되며, 모든 쿼리는 인덱스나 물질화된 뷰에서 실행되도록 설계되어 있습니다. 이는 제5.6절의 “유한 작업(bounded work)” 규칙에 따른 것입니다. [H] (코드 및 라이브 헤더, 2026년 9월).

6.4 Why the design is language-agnostic in the database, not just on paper

이제 독자는 전체 흐름을 파악할 수 있습니다. 새로운 언어는 하나의 language 행(예: 중국어, 코드 cmn)과 등록된 데이터 세트(OMW 중국어 워드넷, UD 중국어 트리뱅크)의 형태로 제공됩니다. 임포터는 해당 언어의 어휘소, 의미, 그리고 — OMW나 기타 명시적인 매핑이 존재하는 경우 — 의미→개념 연결 관계를 기록합니다. 순위 보기(ranking views)가 재계산되고, 시스템에 새로운 언어가 추가되며, 테이블 변경은 없으며, 마이그레이션도 필요 없고, API에 특별한 사례도 없습니다. 이 정확한 경로를 따라 계획된 다음 언어군 — 중국어(만다린), 광둥어, 한국어, 베트남어 — 은 10.3절에 설명되어 있으며, 일정을 결정할 데이터 가용성 조사 결과는 [H](세션 로그, 2026년 9월 7일)에 기록되어 있습니다. 따라서 이 설계가 내세우는 “언어를 무한정 추가한다”는 약속은 단순한 마케팅 문구가 아니라, 스키마가 직접적으로 가져오는 결과입니다.

7 · Two infrastructure lessons: bake-don't-re-derive, and fail-loud

Query latency before and after the materialized-view patterndefault sky8.6s0.25ssky · 1,000 stars + words>60s1.1sper-request ranking0.5s0.02s
Query latency before and after the "bake, don't re-derive" materialized views (warm cache; 2014-era laptop).

모든 데이터베이스 프로젝트는 결국 성능상의 한계에 부딪히게 마련입니다. Lingua Mundi는 일주일 만에 세 가지 한계에 직면했고, 그 과정에서 가장 흥미로운 문제는 속도가 아니라 침묵이라는 사실을 깨달았습니다. 이 섹션에서는 두 가지 이야기를 모두 다룹니다. 왜냐하면 이 두 가지가 합쳐져 이 프로젝트에서 얻을 수 있는 가장 보편적으로 적용 가능한 엔지니어링 교훈을 이루기 때문입니다.

7.1 The pattern: bake, don't re-derive

이 세 가지 성능 장벽을 모두 해결한 규칙은 한 문장으로 요약할 수 있을 만큼 간단합니다. 많은 쿼리가 동일한 계산 집약적인 연산을 필요로 할 때는, 이를 한 번만 계산하고 결과를 저장한 뒤 최신 상태로 유지하며, 매 쿼리마다 다시 계산하지 마십시오. 데이터베이스 용어로 말하자면, Lingua Mundi는 PostgreSQL 구체화된 뷰를 사용합니다. 이는 정답으로 가득 찬 인덱스처럼 작동하는 사전 계산된 테이블입니다.

  • Wall 1 — ranking the sky. 원래는 기본 별자리 지도를 요청한 것이었습니다.

데이터베이스가 전체 코퍼스를 재순위화하도록 강제로 처리함 per request: 약 이 프로젝트에서 사용 중인 2014년형 노트북에서는 매번 8.6초가 소요되었습니다. 이 수정 사항으로 인해 concept_sky_rankconcept_lang_rank로 분류되며 (94,498 및 (218,120개의 사전 계산된 행), 그 후 기본 하늘 데이터가 ~0.25초, 그보다 깊은 요청은 수십 밀리초 [H] (측정값, (2026년 9월 6일).

  • Wall 2 — naming the stars. 하늘을 바라보며 with its words

첨부 파일(언어별 개념별 상위 단어)을 처리하려면 1.6에 걸쳐 조인이 필요했습니다. 모든 요청마다 백만 가지 감각; 별 1,000개일 때 쿼리 처리 시간은 보다 더 오래 걸렸습니다 1분 — 병리학적 사례. 수정 과정에서 단어 자체가 굳어 버렸다: concept_word_rank는 개념별로 상위 4개의 단어를 미리 계산합니다. 언어 (생성 시 338,378행), 1분 이상 걸리던 조인 작업을 ~1.1초의 조회 시간, 그리고 기본 보기에서 ~0.25초의 [H] (측정값, (2026년 9월 6일).

  • Wall 3 — hierarchy and pagination. 오르내리기

분류 체계(렌즈 상하 이동)와 고정된 별 창을 통해 페이지를 넘기는 작업은 정규 술어, 인덱스 정렬 및 안정적인 페이지 분할을 통해 해결됨 그래프 데이터베이스보다는 윈도우(DISTINCT ON 스타일 쿼리) — 8월 “린 스택” 결정(4.5절)의 결과 [H] (코드 및 측정값, 2026년 9월 6일).

가져오기가 끝날 때마다 뷰가 자동으로 새로 고쳐지므로, “베이킹된” 상태가 결코 “오래된” 상태를 의미하지는 않습니다. [H] (스크립트). 이 전체 패턴은 게임 개발자들이 '예산 배분(budgeting)'이라고 부르는 개념의 데이터베이스 고유의 구현 예시입니다. 즉, 비용이 많이 드는 작업은 한 번만 수행되며, 이는 핵심 경로(critical path)에서 벗어나 있으며, 사용자의 요청은 항상 미리 계산된 결과만 읽어들입니다.

7.2 The silent truncation that hid cat

2026년 8월 말, 코퍼스의 영어 레이어가 아무도 상한선으로 의도하지 않았던 행 수 제한과 함께 가져왔습니다. 가져오기를 관리하는 스크립트는 영어 Open Multilingual Wordnet 가져오기를 50,000 후보 — and then reported success [H]로 제한했습니다(세션 로그, 2026년 9월 6일, 근본 원인 항목). 영어 cat는 파일의 알파벳순에서 후보 number 52,195에 해당합니다. 이 항목은 잘려 나갔습니다. 대략 117,659개의 영어 시놉셋 중 21,830개는 아예 생성되지 않았습니다. 해당 의미들에 대해서는 영어 의미가 원시 사전 항목으로 존재했지만, 개념과는 연결되지 않았습니다. 단어 cat는 데이터베이스에서 누락된 것이 아니라 맵에 보이지 않는 상태였습니다: 이 단어의 의미를 검색해도 찾을 수 없었는데, 이는 그 의미 노드가 가리켜야 할 의미 노드 [H]가 구축된 적이 없었기 때문입니다(동일한 출처).

약 6일 동안 아무도 그 사실을 알지 못했다. 저자가 신경 쓰던 데모 — cat · gato · 猫 (별 하나) — 는 스페인어와 일본어에서는 작동했지만 영어에서는 결과가 나오지 않았고, 이 빈 결과는 마치 영어에 해당 단어가 없는 것처럼 보이는 데이터 공백처럼 보였다. (기록에 따르면 시기적 배경은 이렇다. 다국어 하늘 기능은 integrate_core6.py가 8월~9월 수입 작업 막바지에 수입된 언어들의 연결을 완료했을 때 비로소 등장했다. 그 전에는 대체 하늘이 작은 단일 언어 뷰였기 때문에, 공유 개념 뷰가 실제로 가동된 9월 초에야 영어의 빈틈이 드러난 것이다. [H] (세션 로그, 2026년 9월 6일).) 세션 로그에 기록된 저자 본인의 주장은 이것이 "not a data gap — infrastructure" [H]라는 것이었다(세션 로그, 2026년 9월 6일). 그의 말이 맞았다. 실패의 원인은 데이터가 아니라 파이프라인의 정확성에 있었다. 잘린 데이터가 성공적으로 가져온 것으로 보고되었으나, 시스템 내에는 50,000행 제한으로 인한 그 “성공”이 52,195번째 후보에 대해서는 실패를 의미한다는 사실을 감지하도록 설계된 부분이 전혀 없었다.

7.3 The fix: an uncapped, idempotent repair chain

2026년 9월 6~7일에 설계 및 실행되었으며, 2026년 9월 8일에 완료가 확인된(10.1절 참조) 이 복구 작업은 데이터나 신뢰도를 잃지 않고 데이터 파이프라인을 수정하는 방법의 모범 사례입니다. [H] (스크립트 및 세션 로그, 2026년 9월 6~7일):

  1. Re-import the English WordNet without the cap — 항등적으로, 따라서 a

중단된 실행은 행을 중복 생성하지 않고 간단히 다시 시작할 수 있습니다;

  1. 새로 생성된 신셋에 대한 re-run the synset-to-synset relations;
  2. integrate: 새로운 의미 집합을 개념으로 승격하고, 구성원 의미들을 연결한다

concept_id 필드를 사용하고, 개념 관계를 다시 표현하며;

  1. refresh the materialized views, 따라서 지도에는 수리된 내용이 반영되어 있습니다.

코퍼스; 그리고

  1. verify end-to-end와 함께, 다음에서 입증하는 승인 스크립트가 포함되어 있습니다.

데이터베이스와 실시간 API를 통해, 그 영어 cat가 집고양이 콘셉트 princeton-wordnet:02121620-n와 그 다국어 회원들 — gato, chat, Katze, — 그리고 그 개념에는 상위 분류가 있습니다. 유효성 검사는 다음과 같이 설계되어 있습니다. 언제든지 다시 실행할 수 있으며, “PASS” 또는 “FAIL”이라는 큰 소리로 종료됩니다.

모든 단계는 항등성(idempotent)을 갖도록 설계되었기 때문에(get-or-create, skip-if-exists), 복구 도중 시스템이 다운되더라도 시간 외에는 아무런 손실이 발생하지 않습니다. 체인을 다시 시작하면 작업이 완료됩니다. 이러한 특성 덕분에 실시간 데이터베이스가 부분적인 상태로 남는 것을 방지할 수 있습니다.

7.4 The lesson: fail-loud vs. fail-silent

cat 에피소드는 모든 데이터 엔지니어가 두려워하는 문제의 전형적인 사례입니다: a pipeline that fails silently and reports success. 여기서 얻을 수 있는 방법론적 교훈—즉, 행 수 제한이 성공 기준이 아니며, 데이터 가져오기 담당자는 단순히 작업 완료 여부가 아니라 데이터의 완전성을 반드시 확인해야 한다는 점—은 데이터셋이 어떠한 보증도 없이 제공되고 파이프라인이 수작업으로 구축되는 오픈 데이터 인프라에 있어 일반적인 원칙으로 명시할 가치가 있습니다. Lingua Mundi의 대응 방안은 두 가지 형태로 제도화되었다. 향후 모든 수입 체인이 실행할 수 있는 수락 스크립트와, 검증되지 않은 주장은 '미검증'으로 표시된다는 스튜디오의 상시 규칙 — 데이터베이스 내(고아 항목은 가시적으로 유지, 링크에 대한 신뢰도 표시) 및 모든 서면 기록 (본 논문의 [H]/[O]/[NV] 관례, 부록 A)에 명시됩니다. 자신의 고아 항목을 표시할 수 있는 시스템은 그 공백을 찾을 수 있는 시스템이다. 이를 숨기는 시스템은 그 공백이 결국, 최악의 상황에서 cat를 찾는 사용자에 의해 발견될 시스템이다.

8 · The interface: a star map of meaning

데이터 그 자체만으로는 제품이 될 수 없다. Lingua Mundi의 인터페이스를 형성한 질문은 간단했다. what should looking at a map of meaning feel like? 2026년 9월 첫째 주 동안 발전시켜 온 저자의 답은 마치 하늘을 바라보는 듯한 느낌을 주어야 한다는 것이었고, 특히 가상의 보물 행성 지도와 같아야 한다는 것이었다. 즉, 각 별이 하나의 아이디어를 나타내고, 언어가 바로 그 아이디어를 관찰하기 위해 선택한 망원경인, 탐험 가능한 우주의 종이 지도인 각 별은 하나의 아이디어이며, 언어는 그 별을 관찰하기 위해 선택하는 망원경과 같은 [H] (세션 로그, 2026년 9월 1일~7일). 이 섹션에서는 그 결과로 탄생한 인터페이스를 설명한다: 교육적 은유, 시각적 언어, 도구들, 그리고 이 모든 것이 2014년형 노트북에서 구동될 수 있게 해주는 공학적 기법.

8.1 From dictionary page to sky: naming the product

이 인터페이스는 2주 동안 세 번의 정체성 변화를 거쳤으며, 그 이름들은 제품의 진화 과정을 보여줍니다([H], 세션 로그, 2026년 8월 31일 – 9월 6일 ). 처음에는 평범한 사전 페이지("/gui/", 8월 31일 당시 Observatory라고 불림), 9월 1일에는 데이터 가져오기가 완료되고 별자리 시각화가 등장하면서 Planetarium로 바뀌었으며, — 제작자가 결과를 살펴본 후 별들을 “제품이 아니라 비계일 뿐”이라고 선언한 뒤 — 9월 6일 밤, 의미 그래프 탐색기로 전환되었습니다: 같은 하늘이지만, 이제 the point가 의미를 담게 되었으며, 노드는 사용자가 활성화한 언어로 표기된 개념들이고, 에지는 관계 유형별로 색이 구분되며, 검색 기능을 통해 의미의 모호성을 해소합니다. 이전 하늘 뷰는 유지되었으나 연결이 끊겼고, 탐색기가 Lingua Mundi [H]의 기본 화면이 되었다 (세션 로그, 2026년 9월 6일).

8.2 The pedagogical metaphor: an instrument, not a dashboard

인터페이스의 모든 요소는 천문학 및 언어 프로젝트 자체의 개념과 일대일로 대응되는데, 이는 의도적인 교육적 설계입니다(‘은유 표’는 제품의 내부 문서입니다). [H] (세션 로그, 2026년 9월 6~7일):

Star-map elementWhat it really is
A starA concept — one meaning, shared across languages
The stars' brightness (magnitude)A concept's lexical richness and connectedness (Section 5.5)
The language you look throughA telescope — the same sky seen in Spanish, English, Japanese…
Constellations and threadsFamilies of relations — the is-a taxonomy drawn as plotted course lines
Zooming inDescending from the wide sky to a single star and its neighborhood (the Hipparcos→Gaia idea — Gaia Collaboration et al. (2018): more detail the deeper you go)
The exposure dialDeepening the field — asking for more and dimmer stars around a focus
The sextantMeasuring a route between two meanings through the taxonomy
SkymarksBookmarks on stars
The word compassThe enabled languages, ringing the focused star as word chips
The course logYour exploration trail — how you arrived at this meaning

이 모든 것은 단순한 장식물이 아닙니다. 기록에 인용된 바와 같이, 저자가 이 도구에 대해 제시한 설계 개요는 다시 한 번 언급할 가치가 있습니다. 인터페이스는 “장난감이 아닌, 진정한 탐구 도구”여야 합니다 — 학습자나 연구자가 진정으로 탐험할 수 있는 모든 언어의 지도 —이며, 그 출처는 대시보드 [H]가 아니라 탐색 가능한 종이 지도처럼 작동해야 한다 (세션 로그, 2026년 9월 6일). 같은 취지에서 계기판들은 의도적으로 skeuomorphic로 설계되었다: 황동 손잡이가 달린 노출 다이얼, 육분의 측정값, 항로도, 시대 표시 — 메뉴 레이블보다는 감각을 통해 가르치기 위해 선택된, 오래된 천문대의 미학이다.

8.3 What is on screen

2026년 9월에 종단 간 검증을 완료한 탐사기 [H]는 다음과 같은 기능을 제공합니다:

  • Search with sense disambiguation.를 입력하면 gato(스페인어)가 반환됩니다.

meaning-stars; 각 결과에는 어떤 언어의 어떤 단어들이 공통으로 사용되는지 표시될 수 있습니다 그 의미 — 집고양이 스타를 위한 패널에는 다음과 같이 적혀 있습니다. 다국어 시놉셋 구성원, 예: 영어 catgrimalkin, 독일어 Katze, 일본식 (8.5절).

  • Travel. 별을 클릭하거나(또는 Shift 키를 누른 채 클릭하거나 / 박자 키를 누르면)

그것이 초점이 되고, 하늘이 그것을 중심으로 다시 맞춰지며 그 주변이 드러난다.

  • The star panel. ‘포커스드 스타’의 언어별 구성원 수, 그

정의와 그 주변 영역 — 대규모 영역의 경우 페이지 단위로 나뉘어 표시됩니다.

  • The taxonomy lens. 별의 부모에게로 올라가다 (“이게 대체 무슨 종류의...”)

“무엇의?”) 또는 그 자식 요소들로 내려가서 (“이것에는 어떤 종류가 있는가?”) 표준 is-a 계열 술어.

  • The instruments (모두 활성 상태, 검증됨): exposure dial

단계별로 초점이 맞춰진 별의 영역 (90 → 180 → 360 → 720 → 1,000개 별), 다시 여행하지 않고도 더 넓은 하늘을 하나로 합치는 것; sextant의 크기는 두 별 사이의 유계 그래프 경로 (제 X절의 /graph/path 탐색) 5.3), 하늘을 가로지르는 금색 점선 경로를 그리고 각 구간을 기록하며; skymarks 핀 별들 (로컬에 저장되어 있으므로, 나만의 소규모 별자리) (재장전 후에도 유지됨); word compass는 초점이 맞춰진 별을 “word”로 둘러싸고 칩 — 활성화된 언어마다 하나씩 표시되며, 클릭하면 검색 언어를 전환할 수 있습니다. 언어; 그리고 course log, home bearing, epoch stamp, and reticle 상황을 파악할 수 있도록 도와드립니다 [H] (세션 로그, 2026년 9월 7일).

  • The support affordance. “✦ 후원” 컨트롤을 클릭하면 기부 페이지가 열립니다.

모달 (제10절).

8.4 Engineering the sky on 2014 hardware

이 인터페이스의 아름다움은 한 가지 엄격한 제약 조건에 종속됩니다. 바로 2014년형 프로세서, 8GB RAM, 그리고 회전식 디스크를 탑재한 컴퓨터에서 원활하게 작동해야 한다는 점입니다. 바로 데이터베이스를 호스팅하는 그 컴퓨터와 동일한 사양입니다. 이를 가능하게 하는 엔지니어링은 기록해 둘 가치가 있습니다. 이는 제7절에서 다룬 bounded work 방식과 동일한 원칙을 픽셀 [H](감사 및 세션 로그, 2026년 9월 6~7일)에 적용한 것이기 때문입니다:

  • The page renders only on input.의 유휴 CPU 사용률은 약 0%이며, 별다른 활동이 없습니다.

사용자가 어떤 행동을 취하지 않는 한 작동하지 않습니다. 영구적인 것은 없습니다. 애니메이션 — “감자 예산”(9절) 하에서 내린 의도적인 선택.

  • The nebula is baked. 장식용 배경 (보라색/청록색/장미색

(꽃과 먼지)는 크기 조정 시마다 한 번씩 그려진 후 캐시에 저장되며, 프레임마다 재계산하는 대신, 다시 그리기 시 카메라 시차 효과를 적용합니다.

  • Labels are rationed. 프레임당 약 24개의 별 라벨만 그려집니다 — a

라벨 예산 — 재인쇄 비용을 절감하고 텍스트 가독성을 높이기 [H] (the MAX_LABELS = 24를 사용하여 인터페이스 코드의 배치 위치를 제한합니다; (gui/planetarium-v1.html).

  • Requests are protected. 응답 지연 토큰 및 중단 제어

사용자가 다른 곳으로 이동하면 비행 중 쿼리를 취소하고, 더블 클릭 시 보류합니다. 한 번의 클릭으로 동작이 수행되므로 불필요한 데이터 가져오기가 발생하지 않으며, 크기 조정 시 바운스 방지 처리가 적용되고 캔버스 픽셀 비율이 상한값으로 제한됩니다(크기 조정에 사용되는 메모리를 (1080p 기준 약 24MB에서 약 11MB로).

  • Accessibility is explicit: 캔버스 롤 및 ARIA 레이블, 동작 축소

시각적 요소와 동시에 지지대 및 키보드 이동 거리도 추가되었습니다. 폴란드어 [H] (세션 로그, 2026년 9월 7일).

8.5 The demo that ties it together

이 프로젝트의 실제 시연 사례는 ‘cat’라는 단어, 또는 더 정확히 말하면 이 단어가 속한 개념입니다. 탐색기에서 스페인어 ‘gato’를 검색하고 해당 별까지 이동하면, 패널에 ‘princeton-wordnet:02121620-n’ 시놉셋과 현재 사용 중인 언어에 걸쳐 있는 그 구성원들이 표시됩니다. 2026년 9월 6일부터 7일까지 진행된 헤드리스 검사에서 실제로 종단 간 검증이 완료된 부분 집합은 테스트 로그에 기록되어 있습니다. 영어 cat, grimalkinfelis silvestris catus(학명 WordNet 저장), 독일어 Katze, 스페인어 gato, 일본어 — 그리고 데이터베이스가 해당 시놉셋에 대해 저장하고 있는 더 광범위한 구성원 목록(예: 영어 housecat, mouser, puss, tomcat; 프랑스어 chat, chatte; 독일어 Kater; 일본어 ネコ; 포르투갈어 gato, bichano)는 엔드투엔드 로그가 아닌, 가져온 워드넷 구성원 목록에서 유래한 것입니다. 현재의 완전한 열거 목록을 확인하고자 하는 독자는 7.3절의 승인 쿼리를 다시 실행하면 됩니다 [H with [NV] on the untested tail]의 수용 쿼리를 다시 실행하면 됩니다(헤드리스 E2E 로그 및 실시간 데이터베이스, 2026년 9월 6~7일). 별 하나, 여섯 가지 언어, 하나의 의미: 2025년 12월의 직관이 화면에 드러납니다. 이 시연의 영어 부분은 바로 7.2절의 버그로 인해 잠시 중단되었던 부분입니다. 스페인어 기반 gato 검색은 처음부터 별에 도달한 반면, 영어 기반 cat 검색은 커버리지 복구 후에야 작동하며, 7.3절의 승인 스크립트 는 cat · gato · 猫가 동일한 별을 공유한다는 사실을 요청 시 증명하기 위해 존재한다.

9 · The workbench: tools, workflow, and the "potato" machine

프로젝트의 역사에는 그 기반이 된 작업대가 빠질 수 없다. Lingua Mundi의 작업대는 특이한데, 이 작업대가 부과한 제약 조건들이 이 논문에서 다루는 거의 모든 공학적 결정에 영향을 미쳤다.

9.1 The potato

데이터베이스, API, 인터페이스 및 개발 환경을 호스팅하는 기계는 일반 소비자용 노트북 한 대입니다. 바로 인텔 펜티엄 N3540 (Bay-Trail, four cores, no AVX2), 프로세서와 8GB RAM을 탑재한 ASUS X751MA (사용 가능 용량 7.6 GiB), 5400 rpm hard disk, 그리고 약 47 KB/s의 인터넷 업링크를 갖춘 일반 소비자용 노트북 한 대입니다. 이 내용은 2026년 9월 7일 본 논문을 위해 실시간으로 캡처된 것으로 (기기 자체 상에는 [H], lscpu//proc/meminfo로 표시됨). 프로젝트의 노트에서는 이 기기를 Atom Z36xx/Z37xx 또는 Pentium N3540으로 다양하게 기술하고 있는데, 이는 서로 다른 이름으로 표기된 동일한 Bay-Trail 칩셋 계열 [O]; 2026년 초의 채팅 기록에는 또 다른 사양 (인텔 재스퍼 레이크 “N5105” 기기)이 언급되어 있으며, 이는 10.2절에서 해결되지 않은 하드웨어 기록 상의 불일치로 나열되어 있다. 스튜디오는 이 라이브 박스를 애정 어린 별명인 the potato라고 부르며, 기록 전반에 걸쳐 나타나는 규칙을 정했습니다: one heavy operation at a time, 메모리 보호 래퍼, 영구적인 애니메이션 금지, 시기상조인 인프라 금지(4.5절), 그리고 모든 고부하 작업은 은 폴링 방식이 아닌, 완료 시점을 보고하는 자체 알림 기능이 있는 분리된 스크립트로 실행되어야 한다는 것([H], 세션 로그 및 툴링, 2026년 9월). “베이킹, 재파생 금지” 패턴(제7절), 입력 전용 인터페이스 (8.4절), 그리고 LLM 비용이 전혀 들지 않는 연구 환경(9.4절)은 모두, 근본적으로 ‘포테이토’의 결과물이며, 이는 빠듯한 예산이 제한이 아니라 설계상의 장점이 될 수 있음을 증명한다.

9.2 The software stack

The running system (verified live, September 2026 [H]): PostgreSQL 16 as the single datastore (Section 4.5), FastAPI (Python) as the API layer, SQLAlchemy + Alembic for models and migrations, Python scripts for the importers and materialized-view management, and a small dependency-free web interface (HTML/CSS/JavaScript) served from the same origin. Auxiliary machinery includes systemd user services that keep the API and the memory/thermal guard alive (Section 9.5), a daily GitHub backup of the codebase, an Obsidian knowledge base as the project memory (Section 9.3), headless-Chromium end-to-end checks for the interface, and the studio's detach-run + notify tooling for self-alerting background jobs [H] (services and tooling inventory, September 2026).

9.3 The knowledge base: a project memory that can be audited

2026년 8월 26일부터 저자와 그의 대리인들은 모든 작업 세션이 기록되는 체계적인 지식 기반(Obsidian 볼트)을 유지해 왔습니다: 수행된 작업, 내린 결정, 다음 조치, 그리고 각 사실의 출처가 된 파일 등이 기록되며, 서두 부분에는 출처 정보와 verified: true/false 플래그 [H]가 기재되어 있습니다(볼트 관례, 2026년 8월–9월). 이 볼트 덕분에 본 논문은 날짜와 인용문을 제시할 수 있습니다. 이 초안에 “2026년 9월 6일 세션 로그”라고 명시된 부분은, 실제로 존재하며 해당 날짜에 작성되었고 자체 출처 주석을 포함하고 있는 파일을 가리킵니다. 그 볼트의 두 가지 관례는 method로 언급할 가치가 있다. 모든 주장은 그 출처를 명시해야 하며, 역사는 결코 조작되지 않는다 — 확인되지 않은 자료는 보관되지만 미확인([H])으로 표시된다(볼트 관례). 이러한 규약들은 본 논문의 규약이기도 합니다(부록 A).

9.4 Zero-token research and the local-first rule

The author's standing rule — visible in the project note of 29 August 2026 — is that the local API is the research surface: /lexemes, /concepts, /analyze answer questions about the corpus with zero LLM tokens spent [H]. The same local-first instinct governs data (everything self-hosted; nothing depends on a vendor), money (free tiers and open data only; Section 10), and privacy (secrets never leave the machine; the knowledge base is private) [H] (session logs, September 2026).

9.5 Guardrails on a fragile machine

감자에는 여유 공간이 없기 때문에, 스튜디오에서는 그 자체로 엔지니어링 이야기의 일부가 되는 가드레일을 설치했습니다. 바로 memory/thermal guard (tools/mem-manager.sh, v2, 2026년 9월 7일 가동)는 사용 가능한 메모리가 900 MiB 또는 80 °C 미만으로 떨어지면 경고를 보내며, 500 MiB 또는 88 °C 미만이 되면 선택적 백그라운드 유닛을 종료합니다. 또한 시스템 수준의 조기 OOM 킬러(earlyoom -m 8 -s 5, 즉 사용 가능한 메모리가 8% 미만으로 떨어지면 5초 간격으로 작동함)와 [H](실시간 구성: mem-manager.sh 임계값 및 /etc/default/earlyoom, 2026년 9월 7일 확인). 스튜디오의 운영 규칙 덕분에 이러한 안전 장치가 작동할 필요가 전혀 없습니다: one heavy operation at a time, 메모리 보호 래퍼, 그리고 모든 장시간 실행 작업에 대한 자체 알림 기능이 있는 분리된 작업. 장시간 소요되는 복구 작업은 idempotent(get-or-create, skip-if-exists) 방식으로 작성되어, 재부팅, 정전, 가드 트리핑 등 —은 시간 외에는 아무런 비용도 발생시키지 않습니다. 복구 작업을 단순히 재실행하기만 하면 작업이 완료됩니다(7.3절). 이러한 체계는 동시성 자체를 메모리나 디스크와 마찬가지로 예산을 책정해야 할 자원으로 취급합니다.

9.6 Governance: licenses, attribution, and the "free forever" decision

Lingua Mundi에 등록된 모든 데이터셋은 라이선스 정보가 함께 기록되어 있습니다( 저장소의 docs/DATA_LICENSES.md 인벤토리; 운영 중인 데이터베이스의 source 테이블). [H]: WordNet(허용적), Open Multilingual Wordnet (언어별 라이선스, 주로 CC BY-SA 및 CC BY), Wiktionary 및 kaikki (CC BY-SA, GFDL 레거시 조건 포함), Wikidata (CC0), UniMorph (CC BY-SA 3.0), Universal Dependencies (CC BY-SA 4.0), JMdict/KANJIDIC2 및 EDRDG 계열(허용적, 출처 표기 필요), OPUS(데이터셋별), CLICS 및 단어 빈도 목록(출처별) 등 [H](라이선스 목록, 2026년 9월 확인). 이 프로젝트는 상호성을 실천하고 있으며, 프로젝트 자체의 산출물도 마찬가지로 자유롭게 제공될 예정입니다.

funding model는 2026년 8월 말부터 9월 초까지 9일 동안 공개적으로 발전해 왔으며, 기록에 따르면 각 단계인 [H](세션 로그 및 일정, 2026년 8월 29일 ~ 9월 7일)는 다음과 같습니다: 8월 29일, 오프라인 Core-6 사전 앱(Texupan, 29달러 또는 월 9달러)을 판매하겠다는 초기 계획; 9월 1일까지 store hub에 결제 링크가 포함된 스토어 등록; 그리고 — 9월 7일까지 — Lingua Mundi를 free forever로 전환하기로 한 결정(자발적 기부금으로 운영), Stripe 제품의 이름은 말 그대로 "Lingua Mundi — 영원히 무료로 유지"로 정하고, 일회성 가격은 5유로/15유로/50유로, 월간 요금은 3유로/9유로/25유로이며, 인프라 비용과 다음 언어의 데이터 작업인 [H]를 충당하기 위한 €2,400라는 솔직한 연간 목표가 설정되었다(세션 로그, 2026년 9월 7일). 이 계정은 의도적으로 dormant로 설정되었으며 — 작성자가 결제 서비스 제공업체의 신원 확인을 완료할 때까지 기부 기능이 비활성화됨 — 따라서 “영원히 무료”라는 표현은 작성자의 관점에서 볼 때 슬로건이 아니라 verifiable claim에 해당합니다 [H]가 아니라는 점을 명확히 하기 위함이다 (세션 로그, 2026년 9월 7일). 신원 확인은 2026년 9월 8일에 완료되었으며, 그날 아침 6개의 결제 링크가 활성화되었다; 이 링크들은 스토어의 자금 조달 섹션 [H]에 게시되었다 (Stripe 계정 기록 및 결제 링크 내역, 2026년 9월 8일). 대외적으로 공개되는 텍스트는 ‘스튜디오 보이스(studio-voice)’ 규칙(서문)과 ‘정직한 문구(honest-copy)’ 규칙을 따릅니다: 과장이나 과도한 주장은 없습니다 — 이는 데이터베이스와 본 논문을 지배하는 것과 동일한 원칙입니다.

10 · Where the project stands (7 September 2026), its honest limits, and its road ahead

10.1 Current state of the system

2026년 9월 6일부터 7일까지 [H]에서 운영 중인 시스템에 대해 직접 측정한 결과(정확한 쿼리 내용은 부록 A 참조):

  • Corpus (pre-repair snapshot, 6–7 September 2026): 96,434개 개념 · 1,238,383개 어휘 · 1,608,018개 의미 · 171,672개 관계, 6개 활성 언어(영어, 스페인어, 프랑스어, 독일어, 포르투갈어, 일본어) — SQL의 집계 결과는 두 측정 날짜 모두에서 동일하게 재현되었습니다.
  • 수리 보고서(lm-en-coverage-REPORT-2026-09-08.txt, RESULT: PASS)에 기록된 바와 같이, Corpus (post-repair, 8 September 2026):에는 125,980개의 개념 / 125,980개의 시놉셋 / 352,333개의 영어 어휘가 포함되어 있습니다. cat 스타 princeton-wordnet:02121620-n의 다국어 구성원들은 영어, 스페인어, 일본어, 독일어 및 포르투갈어를 아우릅니다(cat, gato, 猫, Katze, Gato doméstico).
  • Ranking views: concept_sky_rank 94,498행; concept_lang_rank

218,120행; concept_word_rank는 생성 시 338,378행 (실시간 재집계 결과) 표준 데이터베이스 역할에 대한 권한이 거부되었습니다(플래그: [NV]).

  • Performance: 기본 하늘 ≈ 0.25초 전 (순위 발표 8.6초 전)

조회수); 'words'가 포함된 1,000개 스타 쿼리의 처리 시간 ≈ 1.1초 ( 'words'가 포함되기 전에는 60초 이상 소요됨) 뷰); 그래프 경로 검색 소요 시간(밀리초); 검색 시간 ≈ 0.5초(예열 상태) / ≈ 10초 하드 디스크의 페이지 캐시에 대한 부하가 적음.

  • Interface: 시맨틱 그래프 탐색기가 API의 웹 오리진에서 가동 중이며,

모든 기구(노출 다이얼, 육분의, 천체 표식, 단어 나침반, 항로 (로그, 에포크 타임스탬프)는 다음에서 수행된 23/23건의 헤드리스 브라우저 종단 간 검사를 통해 검증되었습니다. 2026년 9월 6일~7일.

  • English coverage repair:: 제한이 없는 영어 WordNet 재수입, 관계, 통합, 뷰 갱신 및 종단 간 검증 체인 (7.3절)은 2026년 9월 7일 오전 시작되어 2026년 9월 8일 22:19(2026-09-08 22:19:12)에 완료되었습니다. 승인 게이트를 통과했습니다. 체인 자체 보고서(lm-en-coverage-REPORT-2026-09-08.txt, RESULT: PASS)에는 princeton-wordnet:02121620-n에 대한 개념 연계형 영어 cat 의미가 기록되어 있으며, 여기에는 cat, gato, 猫, Katze, Gato doméstico [H]가 다국어 항목으로 포함되어 있습니다(보고서, 2026년 9월 8일).
  • Governance: 기부 채널 오픈 — 2026년 9월 8일 신원 확인 완료, 스토어에 6개의 결제 링크 게시됨;

작가의 결제 서비스 제공업체 인증; 매일 백업되는 코드베이스; 지식베이스를 최신 상태로 유지합니다.

10.2 What is honestly not known, and what is unresolved

이 연구소의 검증 규정에 따라, 본 논문은 검증할 수 없었던 사항을 명확히 밝히고, 출처 간에 상충되는 내용을 기록해야 합니다. 주요 내용은 다음과 같습니다:

  1. The "Core 6" discrepancy. 저자의 개인 언어 세트 (기록됨)

(2026년 8월 29일)은 스페인어, 영어, 일본어, 프랑스어, Italian, 그리고 포르투갈어. 라이브 데이터베이스에 포함된 6개 언어는 영어, 스페인어, 프랑스어, German, 포르투갈어, 일본어. 독일어는 이탈리아어를 대신하여 서면으로 남아 있는 설명이 전혀 없는 데이터베이스; 이탈리아어 row 및 Italian 데이터셋은 이전에 등록되었지만 라이브 테이블에는 [H]라는 독일어 표기, 그 근거는 [NV]입니다(이에 대해서는 4.2절도 참조하십시오). 사양의 등급에는 중국어와 이탈리아어가 포함되었으나 독일어는 포함되지 않았는데 — (3개월 동안 세 가지 서로 다른 언어 세트가 출간되었다).

  1. Corpus-count drift within a single day. 작성된 기술 문서

2026년 9월 6일 기준 1,146,066개의 어휘항 / 1,595,537개의 의미가 보고된 반면, 같은 날 저녁 SQL의 직접 보고에 따르면 1,238,383 / 1,608,018 (개념 및 비율이 동일함: 96,434 / 171,672); 해당 세션의 로그 저녁에는 세 번째 중간 규모의 어휘군(약 115만 렉셈)이 포함되어 있으며, 하루 종일 계속해서 수입품이 반입되고 있는 상황과 일치합니다. 언어별 합계 SQL 수치와 일치하므로, 이 자료집의 수치는 다음에서 나온 것으로 보입니다. 다른 순간이나 필터; 이 불일치에 대해서는 [H] 레코드를 조정 내역 [O]와 함께 기록합니다. 이 논문은 다음을 인용하고 있습니다. 날짜가 표시된 SQL 도형들.

  1. Hardware records conflict. 라이브 시스템이 호스팅된 서버는

2026년 9월 모델은 본 논문을 위해 ASUS X751MA로 직접 촬영되었습니다. 인텔 Pentium N3540(Bay-Trail) 프로세서, 8GB RAM(9.1절) [H]. 문서 기록은 더 복잡합니다. 프로젝트 노트에는 상자에 대해 다음과 같이 설명되어 있습니다. 인텔 아톰 베이-트레일(Z36xx/Z37xx) 및 펜티엄 N3540으로 — 이 [O]라는 두 가지 상품명으로 출시된 동일한 실리콘 세대 — 반면 이전에는 2026년 대화 기록에는 다른 기계, 즉 인텔이 언급되어 있습니다. 12GB RAM이 탑재된 Jasper Lake "N5105"(2026년 1월) 및 그 이후 모델은 다음과 같이 "Jasper Lake 4 칩" (2026년 5월) 및 "Intel Jasper Lake N5105, 4 GB" (2026년 중반 메모리 파일). 재스퍼 레이크는 베이-트레일 실리콘이 아니므로, 해당 기록은 1년 동안 두 대의 서로 다른 기기에 대한 내용을 담고 있거나 조수의 오기; 현존하는 증거만으로는 어느 쪽인지 판단할 수 없으며, 요점은 여기서 지적된 것이지, [H]를 통해 모호하게 넘어가지는 않았습니다. 조정 [NV] (세션 로그 및 AI 대화 기록, (2026년 1월–9월).

  1. Data-quality warnings from the September audit: 코퍼스에는 다음이 포함되어 있습니다.

178,576개의 중복 어항 쌍; 의미가 없는 124,790개의 어휘항; 전체의 33.9% 정의가 비어 있음; 그리고 (영어 수정 전) 의미의 71.7%가 아직 개념과 연결되어 있습니다. 동일한 감사 결과, 참조 무결성이 유지되고 있는 것으로 나타났습니다. 전체적으로 (합계가 정확하며, 데이터베이스 수준에서 매달린 행이나 고아 행이 없음): 71.7%라는 수치는 not yet linked to a concept 감각을 나타내며, 깨진 링크가 아닌, 눈에 띄는 고아 상태를 의도적으로 설계했습니다 — 솔직한 이 프로젝트는 정렬 작업을 진행하는 동안 의도적으로 이 차이를 그대로 드러내도록 하고 있다 [H] (감사, 2026년 9월 5~6일)가 이어집니다.

  1. 'potato' 이외의 하드웨어에서 Unmeasured or pending:의 성능

측정된 적이 없으며, 이 프로젝트에는 아직 일반 사용자가 없기 때문에 실제 사용에 관한 지표가 없으며, 해당 스튜디오의 법적 구조는 기록들; “남북” 모델링 문제, 광둥어 데이터 부족, 또한 대만 워드넷 라이선스 검토 절차가 공개되어 있습니다(10.3절).

10.3 The road ahead

2026년 8월 29일에 사용자들의 승인을 받은 이 로드맵은 6월 원고의 7개 그래프 [H](프로젝트 노트)를 완성한 형태입니다: 음성학/음운론, 형태론(수입), 구문론(수입), 의미론(수입), 사전학 (수입), 코퍼스(수입), 그리고 — 대기 중 — 담화, 어원, 상응 및 사용 계층, 더불어 향후 공개될 웹 인터페이스입니다. 단기적으로 문서화된 계획은 [H](세션 로그, 2026년 9월 7일) 입니다:

  • The CJKV family. 이 스키마에 향후 추가될 예정인 언어는 다음과 같습니다.

표준 중국어(cmn), 광둥어(yue), 한국어(kor), 베트남어(vie). 이들의 일정은 데이터 가용성에 대한 정직한 실사에 따라 결정됩니다. 오픈 데이터 환경이 제공하는 것에 대해: OMW Wiktionary 워드넷이 존재합니다 표준 중국어(19,079행), 광둥어(527), 한국어(9,268), 그리고 베트남어 (5,498); 표준 중국어(만다린)용 UD 트리뱅크 (123k 토큰), 광둥어 (14k), 한국어 (80k GSD 및 350k KAIST), 베트남어 (58k). 광둥어는 자원이 부족한 쪽 — 방대한 워드넷도 없고, 트리뱅크도 작은 — 그리고 대만어 워드넷 라이선스가 검토 중입니다. [H] (세션 로그 및 데이터) 목록, 2026년 9월 7일). CJKV 데이터셋은 아직 이 초안 작성 시점의 실제 코퍼스; 가족의 일정은 아직 정해지지 않았다 해당 검토 결과가 나올 때까지.

  • Research-v1 interface panes (워드 렌즈, 계보 등반, 필드 카드,

(노트북, 비교표)는 6일에 설계되어 백엔드 측의 승인을 받았습니다. 2026년 9월, [H] 기기 제작 작업 뒤에 대기 중입니다.

  • Publication. 이 논문은 AI가 생성한 초안이며,

인간이 집필한 간행물이 제작 중입니다(서두 부분).

  • Languages without end. 스키마의 약속 — 언어를 하나로 추가하기

row plus 데이터셋 — 이는 이 프로젝트가 밝힌 장기적인 목표이며, 기부 호소문은 다음과 같이 명확히 밝히고 있습니다: Lingua Mundi 처음에는 6개 언어로 시작하며, 이를 무기한 추가할 수 있도록 설계됨 [H] (세션 로그, 2026년 9월 7일).

10.4 Conclusion

2025년 12월 3일, 무료 사전 파일을 요청하는 것으로 시작된 이 프로젝트는 이제 한 사람이 무료 도구와 2014년형 노트북을 이용해 오픈 데이터를 기반으로 구축한, 실시간으로 검색 가능한 6개 언어의 의미 지도입니다. 이 프로젝트를 이끌어온 아이디어들 — 즉, 의미가 다국어 데이터의 자연스러운 단위라는 점, 정렬은 명시적이고 라벨이 붙어 있어야 하며 결코 암묵적으로 추측되어서는 안 된다는 점, 비용이 많이 드는 계산은 는 한 번만 수행하고 여러 번 활용해야 한다는 것; 예산 제약은 설계 도구라는 것; 데이터베이스나 논문 속의 모든 주장은 출처와 날짜를 명시해야 한다는 것 — 이 아이디어들은 새로운 것은 아니지만, 바로 true 그 자체이며, 이 프로젝트는 한 사람이 이러한 아이디어들을 실천에 옮길 수 있음을 보여줍니다. 이 프로젝트의 가장 가치 있는 산물은 데이터베이스 자체가 아니라, 한 명의 연구자가 공개적으로 정직한 인프라를 구축할 수 있음을 보여준 사실일지도 모릅니다. 즉, 측정하는 것을 측정하고, 날짜를 명시하며, 미처 처리하지 못한 항목을 공개하고, 약속을 지키는 것 — 별 하나, 여섯 개 언어, 그리고 앞으로 펼쳐질 온 하늘.

Built in a cave, with a bunch of scraps.

References

APA 제7판. 서지 정보는 2026년 9월 7일 기준 출판사 웹사이트 및 디지털 객체 식별자(DOI) 기록을 통해 확인되었습니다. 소프트웨어 및 데이터 출처는 APA의 소프트웨어/데이터 세트 인용 형식에 따라 인용되었습니다. (본문에서 인용된 문헌만 나열되어 있습니다.)

Bond, F., & Foster, R. (2013). 개방형 다국어 워드넷의 연계 및 확장. 제51차 계산언어학회 연례회의 논문집 (pp. 1352–1362). 계산언어학회 (Association for Computational Linguistics). https://aclanthology.org/P13-1133/

미국 점자 연구소. (2019). Atkinson Hyperlegible [컴퓨터 글꼴]. https://brailleinstitute.org/freefont

Breen, J. W. (2004). JMdict: 일본어-다국어 사전. 다국어 언어 자원 워크숍 논문집 (COLING 2004) (65–72쪽). COLING. https://aclanthology.org/W04-2209/

전자사전 연구개발 그룹. (발행일 미상). JMdict / EDICT 일본어-영어 사전 프로젝트 [데이터 파일 및 문서]. 2026년 9월 7일, https://www.edrdg.org/jmdict/edict_doc.html에서 검색함.

펠바움, C. (편). (1998). WordNet: An electronic lexical database. MIT Press. https://mitpress.mit.edu/9780262561167/wordnet/

가이아 공동 연구팀, Brown, A. G. A., Vallenari, A., Prusti, T., de Bruijne, J. H. J., Babusiaux, C., … Zwitter, T. (2018). 가이아 데이터 릴리스 2: 내용 및 관측 특성 요약. Astronomy & Astrophysics, 616, 논문 A1. https://doi.org/10.1051/0004-6361/201833051

Hernández, R. (2026년 6월 1일). Lingua Mundi: 개념 기반 언어 모델을 위한 의미론적 인프라 (버전 1–7) [미발표 원고; 수정 및 검토 기록은 저자의 대화 기록 아카이브에 보관됨].

Hernández, R. (2026년 7월 24일). 다국어 어휘 플랫폼 — 엔지니어링 사양서 (버전 2.0) [미발표 사양서; 텍스트 추출본 보관 중].

Kirov, C., Cotterell, R., Sylak-Glassman, J., Walther, G., Vylomova, E., Xia, P., 파루키, M., 밀케, S. J., 매카시, A., 큐블러, S., 야로우스키, D., 아이즈너, J., & 훌덴, M. (2018). UniMorph 2.0: 범용 형태소론. 제11회 국제 언어 자원 및 평가 컨퍼런스(LREC 2018) 논문집. 유럽 언어 자원 협회. https://aclanthology.org/L18-1293/

McCarthy, A. D., Kirov, C., Grella, M., Nidhi, A., Xia, P., Gorman, K., 빌로모바, E., 밀케, S. J., 니콜라이, G., 실프베르그, M., 아르한겔스키, T., 크리자노프스키, N., 크리자노프스키, A., 클랴치코, E., 소로킨, A., 맨스필드, J., 에른슈트라이츠, V., 핀터, Y., 제이콥스, C. L., … 야로프스키, D. (2020). UniMorph 3.0: 범용 형태론. 제12회 언어 자원 및 평가 국제 컨퍼런스(LREC 2020) 논문집 (pp. 3922–3931). 유럽 언어 자원 협회. https://aclanthology.org/2020.lrec-1.483/

Meyer, C. M., & Gurevych, I. (2012). Wiktionary: 전문가가 구축한 어휘집에 대항할 새로운 경쟁자? 협업 어휘학 편찬의 가능성 탐구. S. Granger & M. Paquot (편), Electronic lexicography (pp. 259–292)에 수록. Oxford University Press. https://doi.org/10.1093/acprof:oso/9780199654864.003.0013

Miller, G. A. (1995). WordNet: 영어 어휘 데이터베이스. Communications of the ACM, 38(11), 39–41. https://doi.org/10.1145/219717.219748

Nivre, J., de Marneffe, M.-C., Ginter, F., Hajič, J., Manning, C. D., Pyysalo, S., Schuster, S., Tyers, F., & Zeman, D. (2020). Universal Dependencies v2: 끊임없이 확장되는 다국어 트리뱅크 모음. 수록: 제12회 국제 언어 자원 및 평가 컨퍼런스(LREC 2020) 논문집 (pp. 4034–4043). 유럽 언어 자원 협회. https://aclanthology.org/2020.lrec-1.497/

프린스턴 대학교. (발행일 미상). About WordNet. WordNet. 2026년 9월 7일, https://wordnet.princeton.edu/에서 확인함.

SIL International. (발행일 미상). ISO 639-3. 2026년 9월 7일에 다음에서 확인함: https://iso639-3.sil.org/

드 소쉬르, F. (1983). Course in general linguistics (C. Bally, A. Sechehaye, & A. Riedlinger, 편; R. Harris, 역). Duckworth. https://www.bloomsbury.com/us/course-in-general-linguistics-9781472508829/ (원작 1916년 출간)

Speer, R. (2022). wordfreq: 다양한 언어의 단어 출현 빈도 데이터베이스 (버전 3.0) [컴퓨터 소프트웨어]. GitHub. https://github.com/rspeer/wordfreq

Tiedemann, J. (2012). OPUS의 병렬 데이터, 도구 및 인터페이스. 제8회 언어 자원 및 평가 국제 컨퍼런스(LREC 2012) 논문집 (pp. 2214–2218). 유럽 언어 자원 협회. https://aclanthology.org/L12-1246/

Vrandečić, D., & Krötzsch, M. (2014). Wikidata: 무료 협업형 지식베이스. Communications of the ACM, 57(10), 78–85. https://doi.org/10.1145/2629489

위키미디어 재단. (날짜 미상). Wiktionary: The free dictionary. 2026년 9월 7일에 https://www.wiktionary.org/에서 확인함.

Zipf, G. K. (1949). Human behavior and the principle of least effort. 애디슨-웨슬리 출판사. https://archive.org/details/humanbehaviorpri0000zipf

Appendix A · Sources, method, and verification

A.1 The annotation convention

이 연구소의 엄격한 기준(조사 활동에서 유래한)에 따라, 본 논문에서 독자가 그 인식적 상태를 알아야 할 주장에는 다음과 같이 태그가 지정되어 있습니다: [H] = 검증된 사실 — 본 논문을 위해 참조한 측정값, 코드 또는 날짜가 명시된 출처; [O] = 출처를 명시한 해석 또는 의견; [NV] = 검증되지 않음 / 확인되지 않음. 초록과 본문 내의 모든 그림은 날짜가 명시된 [H] 측정값이거나, 라벨이 붙어 있습니다.

A.2 Source families consulted (access 6–7 September 2026)

#SourceWhat it provided
1Live codebase: …/SafeMode/Software Development/LinguaMundi/lingua-mundi (api/, core/, schemas/, importers/, scripts/, docs/, gui/)Architecture, schema, importers, materialized-view SQL, API routes, GUI code
2Live database lingua_mundi (PostgreSQL, 127.0.0.1:5433), direct SQLCorpus counts, language table, synset membership, concept links
3Live API (127.0.0.1:8765): /languages, /graph/sky, /graph/star, /graph/word, /graph/path, /openapi.jsonEndpoint behavior, warm/cold latencies, gzip
4Web interface (127.0.0.1:8765/gui) + headless-browser checksUI behavior; 23/23 end-to-end checks recorded 6–7 Sep 2026
5Vault knowledge base (session logs 26 Aug–7 Sep 2026, handoffs, project notes, conventions)Milestones, decisions, quotes, conventions, dates
6ChatGPT conversation archive (export 5 Sep 2026; 421 conversations with content)Origin and growth conversations, verbatim quotes (Section 1, 3, 4)
7DeepSeek data export (6 Sep 2026; 215 conversations)June 2026 manuscript revision cycle, setup logs
8Claude.ai data export (extracted 6 Sep 2026; legacy-memory file updated 7 Sep 2026)Long-horizon context, project roles
9Personal artifacts in the author's home directory (file timestamps, scripts, specification PDF, journals)Pre-project chronology (Nov–Dec 2025), engineering specification, journals
10Published scholarly and data sources (see References)Background and related work

대표적인 검증 쿼리 (2026년 9월 7일 실행, 역할 lingua): SELECT count(*) FROM concept|lexeme|sense|relation → 96,434 / 1,238,383 / 1,608,018 / 171,672; SELECT code FROM language → deu, eng, fra, jpn, por, spa; 언어별 시놉셋 02121620-n의 구성원 (8.5절); 프로젝트 자체 승인 스크립트 verify-lm-cat-demo.sh (7절).

A.3 Key numbers with dates (compressed timeline)

DateEvent / figure
2025-11-11KANJIDIC2 downloaded (first dataset, file timestamp)
2025-12-03Origin message: "unified multilingual database" (ChatGPT log)
2025-12-05OMW data downloaded; first extract scripts
2025-12-08…16Merge/unified pipeline; four-entity (concept/sense/lexeme/grapheme) JSONL schema
2026-05-01OMW v2.0 coverage study
2026-05-23"Multilingual Lexical Platform" spec master (markdown)
2026-06-01Lingua Mundi named; manuscript V1–V7 revision cycle (DeepSeek + ChatGPT audits)
2026-07-17/18Code scaffolding; feasibility conversation; journal
2026-07-24Engineering Specification V2 (104 pp., PDF)
2026-08-13Lean-stack decision; semantic interaction layer
2026-08-19…25Japanese demo builds; 23 Aug concept descriptions
2026-08-27Daily GitHub backups begin
2026-08-29"LinguaMundi IS the lexicon" decision; roadmap approved; Core 6; Postgres live; UD importer
2026-08-30API routes (CORS, /lookup, /kanji); 27 tests green; first /gui deploy
2026-08-31Import restart (~1.13M rows); English OMW cap seeded the cat bug
2026-09-01Planetarium naming; ≈1.54M rows; store live
2026-09-05Deep audit; pagination fixes; 1,238,383 lexemes
2026-09-06Enrichment audit; materialized-view overhaul (94,498 / 218,120); words bake (338,378); GUI pivot to semantic-graph explorer; cat root cause; research-v1 approval
2026-09-07Instruments live (23/23 E2E); donation setup (dormant); English coverage repair chain launched; CJKV data-availability reconnaissance; this paper drafted
2026-09-08English coverage repair verified complete (8 September 2026 at 22:19); acceptance gate PASS recorded in lm-en-coverage-REPORT-2026-09-08.txt

A.4 Contradictions and unresolved items

10.2절 ‘이탈리아어/독일어 Core-6 간의 불일치’에 기술된 바와 같이, 같은 날의 코퍼스 수 차이(dossier 1,146,066 대 SQL 1,238,383 어휘, 같은 날 저녁 세션 로그에 기록된 세 번째 중간 수치가 있으며, 언어별로 SQL 수치와 일치시킴); 하드웨어 기록 상의 불일치 (Atom Bay-Trail 대 Pentium N3540 대 2026년 초 기록상의 Jasper Lake N5105 — 제10.2절 항목 3); 71.7%의 미연결 의미 및 기타 데이터 품질 경고; 그리고 검증되지 않았거나 문서화되지 않은 항목들: 8월 26일 이전의 정확한 리포지토리 설립 날짜, 언어 세트 변경 사유, 6월 1일 감사 텍스트의 모델 출처(감사 기록은 사용자 측의 작성자 ChatGPT 대화 기록에 남아 있음; 어떤 어시스턴트 모델이 어떤 감사 라운드를 작성했는지는 내보낸 파일에서 독립적으로 확인되지 않음 — 3.3절 참조), concept_word_rank 실시간 재검표(접근 거부), 그리고 스튜디오의 법적 구조.

A.5 Methodology notes

  • 테스트 대상 시스템인 is는 운영 시스템이며, 온도 측정이 수행됩니다.

±0.3초의 하드 디스크 노이즈; 날짜와 시간은 레코드 자체에 기재된 대로 표시됩니다. 시간대 (별도 표기가 없는 한 중부 표준시; DeepSeek 로그에는 +08:00이 사용되었으며, 이는 (변환됨).

  • 인용문은 인용된 로그/파일에서 그대로 가져온 것이며, 줄임표는 생략된 부분을 나타냅니다;

스페인어 인용문은 본문에서 사용된 부분에 영어 해설과 함께 제시되어 있습니다.

  • 이 논문은 그 자체로 AI가 생성한 초안입니다(서두에 명시됨); 이 논문은

위의 출처를 바탕으로 저자의 지도 하에 작성되었으며, 동료 심사를 거쳤습니다. 검증 도구: direct SQL, HTTP 쿼리, 헤드리스 브라우저 검사 및 소스 파일 읽기; 다음에서 제출된 청구 건은 없었습니다. 출처가 존재했던 시절의 기억.

Appendix B · Glossary — plain-language terms used in this paper

How to use this glossary: the first time a technical term appears in the paper it is underlined with dots — hover it (or tap it) for a quick definition, or click it to jump here. This list is alphabetical.
  • Alignment — 한 언어의 단어가 다른 언어의 단어와 같은 의미를 가진다고 판단하는 행위.
  • API — 한 프로그램이 다른 프로그램에 데이터를 요청할 수 있게 해주는 인터페이스(예: 사전 앱이 Lingua Mundi 데이터베이스에 단어를 조회하는 경우).
  • Autonym — 해당 언어의 모국어 사용자들이 그 언어를 부르는 이름(스페인어 사용자들은 스페인어를 español라고 부른다).
  • Bake — 이 프로젝트에서 계산 비용이 많이 드는 결과를 한 번만 구해 저장해 두고, 이를 여러 번 읽어오는 방식을 가리키는 용어입니다(작업 원칙은 “한 번 구해두고, 다시 계산하지 마라”입니다).
  • Breadth-first search — 돌을 던졌을 때 퍼져 나가는 파동처럼, 그래프를 바깥쪽으로 층층이 탐색하여 두 점 사이의 최단 경로를 찾는 방법.
  • CJKV — 중국어, 일본어, 한국어, 베트남어를 아우르는 문자 체계 군을 지칭하는 약어(이 글자들은 각 문자 체계의 이름을 나타냅니다).
  • Concept — 여러 언어에 걸쳐 공통적으로 공유되는 의미(본 논문에서는 특정 단어가 아닌 “집고양이라는 개념”을 의미함).
  • Corpus — 증거로 사용되는 방대한 양의 언어 데이터(텍스트 또는 사전 항목) 모음.
  • Dataset — 단일 출처에서 수집된 데이터의 단일 패키지 모음으로, 고유한 형식과 라이선스를 갖추고 있습니다.
  • Derivation / etymology — 파생이란 기존 단어에서 새로운 단어가 만들어지는 과정을 말하며(run → runner), 어원은 시간과 언어를 초월한 단어의 역사를 의미합니다.
  • ETL — 추출-변환-로드(ETL): 외부 소스에서 데이터를 읽어와 형식을 재구성한 후 데이터베이스에 저장하는 과정.
  • FastAPI — 이 프로젝트가 제공하는 인터페이스(API)를 구축하기 위한 무료 오픈소스 파이썬 프레임워크입니다.
  • Full-text search — 정확한 식별자가 아닌, 저장된 텍스트 내의 단어와 일치시키는 방식으로 데이터베이스를 검색하는 것.
  • Grapheme — 문자: 알파벳 글자, 음절 기호 또는 한자.
  • Graph — 본 논문에서, 유형이 지정된 관계(간선)로 연결된 일련의 의미(노드).
  • Gzip — 인터넷을 통해 전송되기 전에 파일 크기를 줄여주는 표준 압축 방식입니다.
  • HTTP — 웹 브라우저와 API가 인터넷을 통해 데이터를 요청하고 수신하는 데 사용하는 프로토콜입니다.
  • Hypernym / taxonomy — 상위개념 = “한 종류”: felinedomestic cat의 상위개념이다. 분류 체계는 이러한 종류들로 구성된 결과적인 계층 구조이다.
  • Importer — 하나의 외부 데이터 세트를 읽어와 Lingua Mundi의 자체 스키마에 기록할 수 있는 프로그램입니다.
  • Index — 마치 책의 모든 페이지를 일일이 읽지 않고 색인을 통해 빠르게 원하는 내용을 찾는 것처럼, 쿼리를 통해 행을 신속하게 검색할 수 있게 해주는 데이터베이스 구조입니다.
  • Inflection / morphology — 굴절은 문법상 단어의 형태를 바꾸는 것(run → ran)이며, 형태론은 이러한 형태를 연구하는 학문이다.
  • Instance-of / part-of — 그래프에 나타나는 두 가지 관계 유형: “이것은 저것의 한 예이다”(고양이는 포유류 종류의 한 사례이다)와 “이것은 저것의 일부이다”(발은 고양이의 일부이다).
  • Interlingua — 언어 간에 공통으로 사용되는 중간 표현: 스페인어→영어로 직접 번역하는 대신, 스페인어→의미→영어의 순서로 진행합니다.
  • ISO 639-3 — 모든 인간 언어에 고유한 3글자 코드를 할당하는 국제 표준(spa = 스페인어, jpn = 일본어).
  • JMdict / KANJIDIC2 — JMdict는 방대한 규모의 일본어-다국어 사전이며, KANJIDIC2는 이 사전의 부속 파일로, 한자(일본어에서 사용되는 중국 문자)의 발음과 의미를 담고 있습니다.
  • JSON Lines — 각 행이 하나의 데이터 레코드로 구성된 간단한 텍스트 형식으로, 프로젝트 초기 파이프라인 파일에 사용되었습니다.
  • Kaikki — Wiktionary 데이터의 기계 판독 가능 형식 추출본으로, 원본 페이지보다 프로그램에서 읽기 쉽습니다.
  • Kanji — 일본어 문자에 사용되는 중국어 기원의 문자.
  • Lemma — 단어의 사전형(사전에서 찾아보는 형태: cat, cats가 아님; run, ran가 아님).
  • Lexeme — 특정 언어의 단어 형태(문자열 cat).
  • License — 데이터의 사용 및 공유 방법을 규정하는 법적 용어; “오픈” 라이선스는 출처를 명시할 경우 재사용을 허용합니다(예: CC BY-SA).
  • Long tail — 지프 분포(Zipf의 법칙 참조)의 가장 끝부분에 위치한 희귀 아이템의 방대한 집합.
  • Materialized view — 미리 계산되어 저장된 쿼리 결과로, 일정 간격으로 갱신되므로 동일한 질문이 반복되어도 작업을 다시 수행할 필요가 없습니다(“베이크” 패턴).
  • Morphology — 어형과 그 변화 양상을 문법적 관점에서 연구하는 학문(어형변화를 참조).
  • Natural language — 프로그래밍 언어와는 달리, 사람들이 실제로 말하고 쓰는 인간 언어.
  • Node / edge — 그래프에서 노드는 하나의 항목(여기서는 하나의 개념)을 의미하며, 에지는 두 항목(여기서는 유형이 지정된 관계)을 연결하는 것을 의미합니다.
  • OMW / Open Multilingual Wordnet — 영어 WordNet와 정렬된 워드넷 모음집.
  • OPUS — 웹과 영화 자막에서 수집한 방대한 양의 번역 문장 모음집.
  • Orphan sense — 아직 공유된 개념과 연결되지 않은 사전적 의미; 숨기지 않고 그대로 노출되어 있다.
  • Pagination — 긴 결과 목록을 한 번에 모두 전송하는 대신 번호가 매겨진 페이지로 나누어 표시합니다.
  • Part of speech — 단어의 품사: 명사, 동사, 형용사 등.
  • Pipeline — 원시 소스에서 데이터를 가져와 정제 단계를 거쳐 최종 저장소로 이동시키는 일련의 프로그램들.
  • Plugin / registry — 플러그인은 하나의 데이터셋을 위한 작은 추가 프로그램이며, 레지스트리는 이러한 플러그인들에 대한 유일한 공인 목록입니다.
  • Polysemy — 한 단어에 여러 가지 의미가 담겨 있습니다(bank: 강둑 / 돈둑).
  • PostgreSQL — 무료 오픈소스 관계형 데이터베이스(Lingua Mundi 시스템이 모든 데이터를 저장하는 곳).
  • Relation — 두 개념(집고양이 is a, 고양이과)을 연결하는 유형이 지정된 유향 연결.
  • Schema — 데이터베이스의 청사진: 어떤 테이블이 있는지, 각 행에 어떤 내용이 담겨 있는지, 그리고 테이블들이 서로 어떻게 연관되어 있는지.
  • Sense — 한 사전에 기록된 한 단어의 한 가지 의미.
  • Signifier / signified — 소쉬르가 제시한 단어의 두 가지 측면: 그 소리나 형태(기표)와 그것이 가리키는 개념(기의).
  • Sky brightness / magnitude — 해당 의미에 연결된 언어와 단어의 수를 바탕으로, 그 의미가 얼마나 “중요”한지를 나타내는 프로젝트의 순위.
  • SQL — 관계형 데이터베이스에 쿼리를 보내는 데 사용되는 표준 언어.
  • Synset — 특정 맥락에서 동일한 의미를 나타낼 수 있는 단어 집합; Lingua Mundi에서는 시놉셋의 의미가 개념으로 저장된다.
  • Token — 기계 학습에서 모델이 읽거나 쓰는 작은 텍스트 단위(대개 단어 또는 단어의 일부).
  • Treebank — 문법 정보(어떤 단어가 어떤 역할을 하는지)가 주석으로 달린 실제 문장 모음집.
  • UD / Universal Dependencies — 오픈 라이선스 하에 다양한 언어로 된 문법 주석이 달린 문장 데이터를 공개하는 커뮤니티 프로젝트입니다.
  • UniMorph — 단어 형태(굴절) 데이터를 담은 다국어 저장소.
  • URI — 사물에 부여되는 안정적이고 고유한 주소로, 여기서는 개념에 사용됩니다(예: 집고양이의 경우 princeton-wordnet:02121620-n).
  • Wikidata — 기계가 읽을 수 있는 식별자를 갖춘 진술들로 구성된 위키미디어의 구조화된 지식베이스로, CC0 라이선스에 따라 공개되었습니다.
  • Wiktionary — 위키미디어 재단이 운영하는 협업 사전.
  • Word form — 한 언어에서 단어의 표기법 중 하나; 어소 참조.
  • WordNet — 영어의 의미를 기준으로 정리된 최초의 어휘 데이터베이스(프린스턴); OMW는 다른 언어들을 이 데이터베이스에 맞춰 정리합니다.
  • Wordfreq — 여러 언어의 단어 출현 빈도 목록을 담은 데이터베이스로, 단어의 사용 빈도에 따라 순위를 매기는 데 사용됩니다.
  • Writing script — 특정 언어가 쓰이는 문자 집합(라틴 문자, 아랍 문자, 한자 등).
  • Zipf's law — 소수의 단어가 사용량의 대부분을 차지하고, 드문 단어로 이루어진 ‘롱테일’이 나머지를 차지한다는 관찰 결과.