Lingua Mundi: Building a Language-Agnostic Map of Meaning from Open Lexical Data

One idea in every language, on one star.

A project history and technical account · مسودة أولية تم إنشاؤها بواسطة الذكاء الاصطناعي · استوديو RHLS · 7 سبتمبر 2026

متجر RHLS · Lingua Mundi · مدونة · صوت باللغة الإنجليزية · English · Español · Français · Deutsch · Italiano · Português · 日本語 · 한국어 · 简体中文 · 繁體中文 · 廣東話 · हिन्दी · العربية


Notice — preliminary AI-generated draft. This document was drafted by an artificial-intelligence research agent (operating inside the RHLS "DeepSeek Harness" toolchain) at the direction of Raciel Hernández Hernández, the project's author. It is not the final publication: the authoritative, human-authored paper is still in development by Mr. Hernández. Every fact, figure, and quotation in this draft traces to a dated primary source (conversation logs with ChatGPT, Claude, and DeepSeek; project journals and session logs; the software repository and its documentation; and direct measurements of the live database and application programming interface), and the sources are listed in the appendix. Statements that could not be verified are explicitly marked. No claim in this draft should be treated as peer-reviewed or as final wording.

How to read this paper. وقد كُتب هذا الدليل للأشخاص الذين هم not علماء اللغويات الحاسوبية وnot المبرمجين. عندما يظهر مصطلح تقني لأول مرة، يتم تمييزه بخط منقط تحت الكلمة: مرر مؤشر الفأرة فوقه (أو اضغط عليه) للحصول على تعريف بلغة بسيطة، أو انقر عليه للانتقال إلى المسرد الكامل (الملحق ب). كل مرجع وكل أداة أو مصدر بيانات مذكور مرتبط بمصدره الأساسي أو وثائقه الرسمية. يمكن للقراء الذين يرغبون فقط في قراءة القصة الاطلاع على الأقسام 1–3 و10؛ أما الأقسام الوسطى فتوثق الجوانب الهندسية بالتفصيل.

تم ابتكار Author and contribution statement. وLingua Mundi وتصميمهما، ويتم تطويرهما حاليًا على يد راسييل هيرنانديز هيرنانديز، وهو باحث مستقل ومترجم مقيم في تاباسكو، المكسيك. ويجري التطوير في إطار تعاون يقوده الإنسان مع نماذج لغوية تجارية ضخمة — مثل ChatGPT، و«كلود» من شركة Anthropic، ونماذج الدردشة والاستدلال من DeepSeek — والتي يستخدمها المؤلف كشركاء في البرمجة، ومراجعين، وأدوات مساعدة في التوثيق. وقد كُتبت هذه المسودة نفسها بواسطة وكيل ذكاء اصطناعي تحت إشراف المؤلف و تتبع قواعد التحقق الخاصة بالاستوديو: تشير [H] إلى حقيقة تم التحقق منها مقارنةً بمصدر مؤرخ أو قياس أو كود؛ [O] تشير إلى تفسير أو رأي منسوب؛ [NV] تشير إلى بيان لم يمكن التحقق منه. يُكتب النص العام بصيغة الاستوديو بدلاً من الصيغة الشخصية للمؤلف، وفقًا لأعراف الاستوديو.

[H] Studio-voice rule (session log, 7 September 2026): "Studio/PR voice on all external/pitch copy — never Rex's personal voice." [H] Honesty rule: "No lies / no fake confidence" (studio conventions, September 2026).

Abstract

يتم تنظيم القواميس البشرية وشبكات الكلمات وفقًا لنظام by language: ملف كلمات باللغة الإسبانية، وآخر باللغة الإنجليزية، وآخر باللغة اليابانية. لكن معنىً مثل «القط المنزلي» ليس إسبانيًا ولا إنجليزيًا ولا يابانيًا — فهو مشترك بينها جميعًا، وكل لغة تشير إليه ببساطة بشكل ظاهري مختلف: gato، cat، chat، Katze، . Lingua Mundi («لغة العالم») هي قاعدة معرفية معجمية مفتوحة ومجانية و محايدة لغويًا تحاول عكس التنظيم المعتاد: بدلاً من القواميس لكل لغة، تقوم بتخزين concepts (المعاني) مرة واحدة، وتربط كلمات كل لغة بتلك المعاني المشتركة، مستخدمة شبكات الكلمات متعددة اللغات الخاصة بمجتمع البيانات المفتوحة كـ مفتاح للمواءمة. يتم تطوير المشروع بواسطة شخص واحد، على جهاز كمبيوتر محمول واحد من طراز عام 2014 (معالج من فئة Intel Pentium رباعي النوى، وذاكرة وصول عشوائي (RAM) سعة 8 جيجابايت، و قرص صلب بسرعة 5400 دورة في الدقيقة، واتصال إنترنت بطيء — الجهاز الذي يستضيف النظام الحي، والذي تم التقاط صور له مباشرةً من أجل هذه الورقة؛ انظر القسم 9.1)، بميزانية صفرية، باستخدام البيانات المعجمية المفتوحة فقط. بين ديسمبر 2025 وسبتمبر 2026، نما المشروع من مجلد يحتوي على ملفات قواميس تم تنزيلها إلى قاعدة بيانات PostgreSQL فعالة تضم 96,434 concepts و1,238,383 word forms (lexemes) و 1,608,018 word senses، و171,672 semantic relations عبر ست لغات حية (الإنجليزية، والإسبانية، والفرنسية، والألمانية، والبرتغالية، واليابانية)، و استعلام API الذي يقدم الإجابة في أجزاء من الألف من الثانية، وواجهة ويب مصممة على شكل «خريطة المعنى» — خريطة نجمية قابلة للاستكشاف يمكن أن يكون فيها نجم واحد cat · gato · 猫 · chat · Katze في آن واحد. توثق هذه الورقة الأصل الفكري للمشروع (الحدس القائل بأن المعنى، وليس التهجئة، هو الوحدة الطبيعية لبيانات اللغات المتعددة)؛ المبادئ الرياضية واللغوية لتصميمه (نموذج كيانات غير مرتبط بلغة معينة، ومواءمة المفاهيم القائمة على مجموعات المعاني، وتصنيف للعلاقات المصنفة، وترتيب زيبفي، ونمط العرض المادي «الخبز، لا إعادة الاشتقاق» المستمد من ممارسات قواعد البيانات)؛ مصادر البيانات المفتوحة وتراخيصها؛ الأدوات وسير العمل بين البشر والذكاء الاصطناعي المستخدمة في بنائه؛ واجهة المستخدم وتصميمها التربوي؛ أعطال البنية التحتية التي تم اكتشافها خلال العملية — بما في ذلك خطأ اقتطاع خفي جعل الكلمة الإنجليزية cat غير مرئية لمفهومها نفسه (سلسلة إصلاحها، التي أُطلقت في 7 سبتمبر 2026 وتأكد اكتمالها في 8 سبتمبر 2026)؛ الحالة الحالية للمشروع؛ وخططه. وتعد هذه الورقة أيضًا، ضمناً، دراسة حالة لما يمكن لشخص واحد عازم أن يبنيه على البيانات المفتوحة باستخدام أدوات مجانية وقدرات حاسوبية مستعارة — وفي العادات الهندسية (القياس، والتأريخ، والتصنيف، والاعتراف بما لم يتم التحقق منه) التي تجعل مشروعًا صغيرًا نزيهًا بما يكفي لينمو ويصبح مشروعًا كبيرًا.

تم جمع الأرقام والإحصاءات الواردة في هذا الملخص في الفترة من 6 إلى 7 سبتمبر 2026؛ انظر الملحق أ للاطلاع على الاستعلامات والتواريخ والمصادر الدقيقة.

96,434مفاهيم · معانٍ
1,238,383صيغ كلمات · معجمات
1,608,018معانٍ لكلمات
171,672علاقات دلالية
6لغات حيّة
0.25 sالسماء الافتراضية · دافئة
مسودة أولية مولّدة بالذكاء الاصطناعي. صاغ هذا المستند وكيل بحث بالذكاء الاصطناعي بتوجيه من Raciel Hernández، مؤلف المشروع. وهو ليس المنشور النهائي — فالنص الذي يكتبه المؤلف بشرًا لا يزال قيد الإعداد — ولم يخضع لمراجعة الأقران. كل حقيقة ورقم تعود إلى مصدر أولي مؤرّخ مذكور في الملاحق؛ والادعاءات غير الموثقة معلمة صراحة. لا تقتبس دون موافقة المؤلف.

1 · The intuition: why dictionaries are the wrong shape

One concept, six languages: the domestic-cat synset 02121620-n 02121620-n domestic cat EnglishcatgrimalkinhousecatmouserpussSpanishgatoFrenchchatchatteGermanKatzeKaterPortuguesegatobichanoJapaneseネコ
One concept, six languages — members of the domestic-cat synset princeton-wordnet:02121620-n (verified subset, September 2026).

لقد شعر كل متعلم للغة بهذا التباين. تبحث عن «cat» في قاموس إنجليزي-إسباني فتجد «gato». تبحث عن «gato» في قاموس إسباني-ياباني فتجد «». وبعد مراجعة ثلاثة قواميس، تكون قد أمضيت فترة ما بعد الظهر في تأكيد ما كنت تشك فيه بالفعل: نفس المفهوم — وهو حيوان مفترس صغير مستأنس يصدر صوت هرير — يتم وصفه ثلاث مرات، في ثلاثة ملفات منفصلة، من قبل ثلاث مؤسسات مختلفة، بثلاثة معرفات مختلفة، دون أي ارتباط بين اثنين منها.

الفكرة الأساسية وراء Lingua Mundi هي أن هذا الشكل غير مناسب للبيانات اللغوية. فالمعنى موجود مرة واحدة فقط. أما الكلمات فتتكرر مرات عديدة. إن قاعدة البيانات التي تخزن meanings ككائنات من الدرجة الأولى، وتعامل words على أنها تسميات تربطها اللغات المختلفة بتلك المعاني، ستسمح لأي شخص (أو برنامج) بالانتقال من أي لغة إلى أي لغة أخرى عبر خريطة واحدة مشتركة — وستسمح للمتعلم أن يرى، بنظرة واحدة، أن cat، gato، chat، Katze, and ليست خمس حقائق يجب حفظها، بل حقيقة واحدة ترتدي خمسة أزياء.

لم تكن هذه الفكرة بمثابة صاعقة. بل نمت، على مدار عام تقريبًا، من العمل اليومي لشخص معين — وأقدم أثر توثيقي لها يتسم بالبساطة بشكل لافت للنظر.

1.1 The first message

على 3 December 2025، بدأ المؤلف محادثة مع ChatGPT و كتب ما يلي (مقتبس حرفيًا؛ ظلت المحادثة مفتوحة لمدة أربعة أشهر ونصف، وتم تحريرها آخر مرة في 21 أبريل 2026) [H]:

"I want to find free dictionaries similar to JMDICT and Kanjidict2 for the following languages: Spanish, English, French, Italian, Portuguese, Chinese, Korean and Vietnamese. My intent is to create a unified multilingual database for various purposes. I'm also interested in knowing if similar databases exist for indigenous Mexican languages that I can freely access."

(سجل الجلسة، ChatGPT، المحادثة بعنوان «قواميس متعددة اللغات مجانية»، 3 ديسمبر 2025؛ الملف المصدر مذكور في الملحق أ.)

هناك ثلاثة عناصر في تلك الرسالة القصيرة تنبئ بكل ما أصبح عليه المشروع لاحقًا. أولًا، اللغات المذكورة — الإسبانية، والإنجليزية، والفرنسية، والإيطالية، البرتغالية، ثم اليابانية لاحقًا — هي بالضبط اللغات التي يتحدثها المؤلف ويعمل بها كمترجم ومدرس لغات (وهي مجموعة سيقوم لاحقًا بتسميتها رسميًا باسم «Core 6»)، بالإضافة إلى الصينية والكورية والفيتنامية، التي كان يخطط لإضافتها لاحقًا. ثانيًا، العبارة «قاعدة بيانات unified متعددة اللغات» تحدد الهدف بالفعل: ليس ستة قواميس، بل قاعدة بيانات واحدة تضمها جميعًا معًا. ثالثًا، كان المؤلف يفكر في indigenous Mexican languages منذ اليوم الأول — وهو خيط يتكرر مرارًا (تم استكشاف تكامل لغة المايا مع Lingua Mundi في أغسطس 2026 [H]، وتظهر موارد لغة المايا في جميع أنحاء ملاحظاته البحثية).

كما أن السياق الكامن وراء تلك الرسالة مهم أيضًا. المؤلف ليس عالم كمبيوتر من حيث التخصص. إنه مترجم ومدرس لغات كان في ذلك الوقت يتعلم اللغة اليابانية بجدية، ويقوم بإنشاء أدوات صغيرة لتسهيل التعلم: ألعاب لتعلم الكانجي والكانا، وقناة لإنشاء القواميس اليابانية (سيُضاف إلى مجموعة الأدوات هذه لاحقًا، في عام 2026، محرر فوريغانا للكتب الإلكترونية اليابانية لاحقًا، في عام 2026، باعتباره المشروع الذي أصبح تطبيق Shikibu). ويُظهر دليل ملفاته الرئيسية في أواخر عام 2025 «التاريخ» لتلك المرحلة من التعلم: نسخة من ملف قاموس الكانجي KANJIDIC2 الذي تم تنزيله على 11 November 2025، وقائمة كانجي «جويو» في ديسمبر، ثم — استجابةً لتلك المحادثة التي جرت في 3 ديسمبر — بيانات Open Multilingual Wordnet التي تم تنزيلها على 5 December و[H] (طوابع زمنية للملفات، /home/rex/؛ انظر الملحق أ). بعبارة أخرى، تُعد محادثة ChatGPT التي جرت في 3 ديسمبر نقطة التحول: اللحظة التي اتسعت فيها عبارة «أحتاج إلى بيانات يابانية لأدواتي» لتصبح «أريد بناء قاعدة بيانات موحدة متعددة اللغات، مجانًا، للعديد من اللغات، بما في ذلك لغات بلدي ».

1.2 From dictionaries to meanings: the December 2025 pipeline

ما فعله المؤلف بعد ذلك يتضح من الملفات التي أنشأها. ففي الفترة ما بين 5 ديسمبر و16 ديسمبر 2025، كتب — بمساعدة ChatGPT كشريك في البرمجة — سلسلة صغيرة من البرامج النصية Pythonextract_omw.py، merge_dicts.py، unified_dictionary_pipeline.py، crossref_deterministic.py — التي قامت بتنزيل البيانات المعجمية وتحليلها ودمجها من عدة مصادر مفتوحة إلى أشكال أكثر تنظيماً تدريجياً [H] (البرامج النصية والتواريخ موجودة في /home/rex/). أهم قرار تصميمي في هذه الفترة موثق في الملفات نفسها: المرحلة النهائية من سلسلة العمليات ، المؤرخة في 16 ديسمبر، تقسم كل إدخال إلى four kinds of objectsconcept، وsense، وlexeme، وgrapheme (حيث يُقصد بالغرافيم حرفًا مكتوبًا مثل الكانجي) — وتقوم بكتابتها على القرص كوثائق JSON Lines . ويوضح المخطط ما يلي: sense هو معنى معين لكلمة معينة في قاموس معين؛ وconcept هو المفهوم المشترك الذي تشير إليه عدة معانٍ عبر عدة لغات؛ ويُسمح بأن يكون يُسمح بأن يكون حقل concept_id الخاص بأحد المعاني هو empty — مما يعني أن «هذا المعنى للكلمة لم يتم ربطه بعد بمفهوم مشترك». تصف ملاحظات المؤلف في ذلك الكود الطريقة بأنها «صفر استدلال»: لا تخمين غامض، ولا حيل تشابه إحصائية لتحديد أن كلمتين تعنيان الشيء نفسه؛ فقط روابط صريحة وموثقة. [H] (كود خط الأنابيب والتعليقات التوضيحية، /home/rex/، ديسمبر 2025؛ التفاصيل في الملحق أ.)

إن مخطط 16 ديسمبر هذا يمثل، في صورة مصغرة، البنية الكاملة للمشروع الذي سيُطلق عليه لاحقًا اسم Lingua Mundi: الكلمات موجودة في اللغات؛ والمعاني موجودة في فضاء مشترك؛ أما المشكلة الصعبة والصادقة — أي كلمة في أي لغة تعني أي مفهوم — فلا يتم تزويرها أبدًا. يتم الاحتفاظ بالمعنى الذي لم يتم ربطه بمفهوم ما في قاعدة البيانات، بشكل واضح غير مرتبط، بدلاً من أن يتم تخمينه صامتًا ووضعه في مكانه. وبعد عشرة أشهر، عندما تسبب خطأ في خط أنابيب الاستيراد في إخفاء الكلمة الإنجليزية cat عن مفهومها، وصف المؤلف المبدأ بهذه العبارات بالضبط: من الأفضل إظهار الكلمة اليتيمة بدلاً من إخفائها ([H]؛ انظر القسم 7).

1.3 The gap, and the widening

ثم توقفت السجلات المكتوبة لمدة خمسة أشهر تقريبًا — من منتصف ديسمبر 2025 حتى أواخر مايو 2026، ولا تحتوي السجلات المتاحة على أي أعمال متعلقة بـ«مسار القاموس» [NV]. وهذا أمر غير مستغرب بالنسبة لمترجم يعمل ويقوم بتدريس الطلاب، لكن يجدر التنويه بوضوح إلى أن نمو المشروع كان not مستمرًا. فقد تقدم المشروع على فترات متقطعة، تفصل بينها أسابيع أو أشهر من الأعمال الأخرى — وهو إيقاع استمر طوال عام 2026.

عندما استؤنف الموضوع، اتسع نطاق الطموح. في 1 May 2026، يدرس المؤلف «تغطية بيانات OMW v2.0» (الإصدار Open Multilingual Wordnet ) [H] (عنوان المحادثة ومحتواها، ChatGPT، 2026-05-01). في 27 May 2026، يفتح محادثة بعنوان «موارد اللغة مفتوحة المصدر» "، ويطلب، في الواقع، خريطة منهجية لكل مورد معجمي ونحوي ودلالي مجاني يمكن أن يغذي قاعدة معرفية متعددة اللغات [H] (ChatGPT، 27 مايو 2026). وقد أصبح للمشروع الآن اسم وشكل؛ وتظهر الأدلة على كليهما في الفصل التالي.

1.4 Why this matters beyond one person's project

قد يتساءل القارئ عن سبب توثيق ورقة بحثية لـ«الحدس» الكامن وراء مشروع شخصي بهذه التفاصيل. والجواب هو أن هذا الحدس هو المساهمة بحد ذاتها. فالفكرة القائلة بأن meanings — وليس التهجئات — هي الوحدة الطبيعية للبيانات متعددة اللغات لها تاريخ أكاديمي طويل (فهي أقدم حلم في تقاليد «اللغة الوسيطة» للترجمة الآلية والمبدأ التنظيمي لمجموعات المعاني في Princeton WordNet؛ انظر القسم 2)، لكن نادرًا ما يتم تنفيذها من قبل فرد، بدون ميزانية، كمنفعة عامة. معظم الموارد متعددة اللغات التي تتبع هذا المبدأ — مثل Open Multilingual Wordnet وBabelNet ومشروع Universal Dependencies — يتم صيانتها من قبل اتحادات جامعية بتمويل من المنح. يُعد Lingua Mundi محاولة من قبل باحث مستقل واحد، باستخدام البيانات المفتوحة والأدوات المجانية فقط، لبناء جزء من تلك البنية التحتية بنفسه، من أجل أعماله الخاصة في الترجمة والتدريس ، ولتقديمها مجانًا. أما ما إذا كانت هذه المحاولة ستنجح أم لا، فهذا سؤال يمكن للقارئ أن يحكم عليه من الأدلة الواردة في بقية هذه الورقة — وتُظهر مذكرات المؤلف نفسه أنه كان يطرح السؤال نفسه، بنفس الصدق، طوال الوقت (انظر القسم 4.3).

2 · Background: what "a map of meaning" means

لفهم ما تسعى Lingua Mundi إلى بنائه، وما هو الجديد حقًّا فيه، هناك ثلاثة محاور من الأعمال السابقة ذات أهمية: الفكرة اللغوية القائلة بأن المعنى يمكن فصله عن التهجئة؛ والفكرة الحاسوبية التي تنص على أن هذا المعنى يمكن تخزينه كبيانات وربطه عبر اللغات المختلفة؛ والملاحظة الحديثة التي تشير إلى أن الخريطة المنظمة للمعنى تكمل — بدلاً من أن تتنافس مع — النماذج اللغوية العصبية.

2.1 The sign and its two faces

تبدأ اللغويات الحديثة بملاحظة تبدو بسيطة للوهلة الأولى، وعادةً ما تُنسب إلى محاضرات فرديناند دي سوسير في أوائل القرن العشرين: الكلمة هي اقتران بين sound/shape («المرمز») و concept (الـ «المعنون») (de Saussure, 1916/1983). ووفقًا لهذا الرأي، فإن اللغتين ليستا مجموعتين من الكلمات التي تصادف أن تكون مترجمة؛ بل هما مجموعتان من signifiers تتداخلان جزئيًا في مساحة مشتركة من signifieds. المُشير الإنجليزي cat والمُشير الإسباني gato هما شكلان مختلفان لهما نفس المُشار إليه. إذا تمكنت الآلة من تخزين «المعاني» مرة واحدة وربط «الدلالات» بها، فإن الترجمة ستصبح عملية بحث عبر وسيط مشترك — وهي فكرة تُعرف في الترجمة الآلية باسم نهج interlingua : بدلاً من الترجمة من الإنجليزية إلى الإسبانية مباشرةً، تتم الترجمة من الإنجليزية إلى المعنى ثم إلى الإسبانية.

لحلم «اللغة المشتركة» تاريخ طويل في مجال أبحاث الترجمة الآلية، وقد ثبت مرارًا وتكرارًا أنه صعب المنال في إطاره العام الكامل (فاللغات لا تقسم المعنى إلى أجزاء متطابقة، وكل مترجم يعرف أن cat الحيوان وcat عازف الجاز هما معنيان مختلفان يرتديان المرمز نفسه). لكن الحلم لم يمت أبدًا؛ بل تم تضييق نطاقه ليصبح شيئًا قابلًا للبناء: المعجم، وهو الجزء من اللغة الذي يتطابق بشكل أفضل مع المعاني المستقرة والمشتركة.

2.2 WordNet and the synset

جاء التضييق الحاسم في نطاق المصطلح من علم النفس وعلم المعجم. في الثمانينيات والتسعينيات، أنشأ جورج ميلر وزملاؤه في جامعة برينستون «WordNet»، وهي قاعدة بيانات معجمية للغة الإنجليزية لم تُنظم أبجديًّا بل وفقًا لـ semantically (Miller, 1995؛ Fellbaum, 1998). ويكمن الابتكار الأساسي في WordNet في مفهوم synset (اختصار لـ «مجموعة المرادفات»): وهي مجموعة من الكلمات التي يمكن أن تشير إلى المعنى نفسه في سياق معين. مجموعة المرادفات {cat، true cat، Felis catus، domestic cat} is one meaning; the synset {cat، kat, guy, hombre} — التي تعني «مصطلح غير رسمي يشير إلى شاب أو رجل» — هي معنى آخر مختلف تمامًا يصادف أنه يشترك في الدال cat. كما يسجل WordNet relations بين مجموعات المرادفات — وأهمها التسلسل الهرمي is-a (التسمية الشاملة: القطة المنزلية is an من فصيلة القطط، والقطط is an من فصيلة آكلي اللحوم، و آكلي اللحوم is an* من فصيلة الثدييات…) — مما يحول القاموس إلى رسم بياني، حيث تمثل المعاني العقد والعلاقات المصنفة الحواف.

يُعد WordNet مهمًا بالنسبة لـ Lingua Mundi لثلاثة أسباب. أولًا، فقد أثبت أن المعجم القابل للقراءة آليًّا والمنظم حسب المعنى أمرٌ ممكن ومفيدٌ للغاية — فما زالت محركات البحث الحديثة، وبرامج التدقيق الإملائي، ومكتبات اللغة الطبيعية تعتمد عليه. ثانيًا، قدم للعالم نظام تعريف مستقر للمعاني: يقوم Princeton WordNet بترقيم مجموعات المرادفات الخاصة به، لذا فإن 02121620-n يعني بشكل لا لبس فيه «القط المنزلي» ويمكن الاستشهاد به عبر قواعد البيانات. ثالثًا، أصبح هذا المشروع ركيزة لمشروع متعدد اللغات: Open Multilingual Wordnet (OMW).

2.3 The Open Multilingual Wordnet: one meaning, many languages

مشروع OMW، الذي أطلقه فرانسيس بوند ورايان فوستر (Bond & Foster, 2013)، يجمع شبكات الكلمات (Wordnets) التي تم إنشاؤها بالعديد من اللغات ويقوم بمواءمتها مع شبكة الكلمات الإنجليزية في برينستون: حيث تحتوي مجموعات المرادفات لكل لغة مشاركة على مؤشرات إلى مجموعة المرادفات الإنجليزية المقابلة لها. والنتيجة هي المورد الذي جعل Lingua Mundi ممكنًا: مجموعة من العبارات الصريحة التي نظمها البشر بالصيغة «السبانية gato (المعنى 1) تنتمي إلى نفس المعنى الذي تنتمي إليه مجموعة المعاني الإنجليزية domestic-cat رقم 02121620-n». عندما كتب مؤلف Lingua Mundi في مواصفاته الهندسية الصادرة في يوليو 2026 أن المشروع سيكون «متمحورًا حول مجموعات المعاني» وسيقوم بمواءمة اللغات من خلال OMW [H] (وثيقة المواصفات، 24 يوليو 2026)، كان يستند إلى أعمال بوند وفوستر — تمامًا كما كانت نصوص خط أنابيب ديسمبر 2025 الخاصة به، التي قامت بتحليل ملفات بيانات OMW مباشرةً، قد فعلت من قبل.

2.4 The open-data ecosystem around the wordnets

يُعد OMW إحدى العقد في نظام بيئي واسع النطاق مرخص بموجب ترخيص مفتوح، يمكن لأي فرد دمجه بشكل قانوني وتقني:

  • Wiktionary — القاموس التعاوني الذي تستضيفه مؤسسة ويكيميديا

Foundation — يوفر تغطية معجمية واسعة جدًّا في مئات اللغات، بما في ذلك التعريفات والترجمات والتصريفات والنطق، تحت عنوان تراخيص «المشاركة على نفس الشروط» (Wikimedia Foundation؛ انظر أيضًا Meyer & Gurevych، [2012, بشأن قيمتها كمنافس لـ «Expert-Lexicon»).

  • Wikidata — قاعدة المعرفة المنظمة التابعة لويكيميديا — تخزن العبارات

مع معرّفات قابلة للقراءة آليًّا، ويتم نشرها بموجب ترخيص CC0 (عام) المجال) (Vrandečić & Krötzsch, 2014).

قواعد بيانات الجمل المُعلَّمة نحويًّا في أكثر من مائة اللغات الخاضعة لتراخيص مفتوحة (Nivre et al., 2020). تساهم جامعة دالاس (UD) في ذلك جمل حقيقية ومعلومات عن فئات الكلام — دليل على كيفية استخدام الكلمات يُستخدم فعليًّا.

يديرها مشروع EDRDG التابع لجيم برين، ويغطي اللغة اليابانية على نطاق واسع وبترجمات إلى عدة لغات (Breen, 2004). كانت هذه هي نقاط انطلاق المؤلف (ملف القاموس الأول الذي أنشأه، تم تنزيله في نوفمبر 2025، وكان KANJIDIC2 [H]).

  • UniMorph — مستودع متعدد اللغات للمورفولوجيا التصريفية (الكلمة

(أشكال مثل run/ran/running مصنفة حسب السمة النحوية) (Kirov et al., 2018؛ McCarthy et al., 2020).

  • OPUS — مجموعة كبيرة من الجمل المتوازية (المترجمة) المستخرجة

من الإنترنت ومن ترجمات الأفلام، المرخصة بموجب ترخيص مفتوح (Tiedemann, 2012).

الكلمات حسب مدى شيوعها في المجموعات النصية الحقيقية.

  • The ISO 639-3 standard، الذي يخصص لكل لغة بشرية رقمًا ثابتًا

رمز مكون من ثلاثة أحرف (على سبيل المثال، spa للغة الإسبانية، وjpn للغة اليابانية)، يتم الاحتفاظ به بقلم SIL International — Lingua Mundi تستخدم قاعدة البيانات هذه الرموز كمفاتيح لجدولها language و[H].

هناك خاصيتان لهذا النظام البيئي تستحقان التأكيد عليهما لأنهما تشكلان هيكل المشروع بأكمله. أولاً، التراخيص مفتوحة حقًّا — سواء كانت متساهلة أو تتطلب المشاركة على نفس الشروط — لذا فإن دمجها في قاعدة بيانات مشتقة يعد أمرًا قانونيًا طالما تم احترام شروط الإسناد وشروط الترخيص (يسجل Lingua Mundi المصدر والترخيص لكل مجموعة بيانات مستوردة في جدول source الخاص به؛ انظر القسم 6). ثانيًا، النظام البيئي هو complementary: Wiktionary واسع النطاق ولكنه سطحي؛ وشبكات الكلمات (wordnets) عميقة ولكنها ضيقة النطاق؛ وUD يتعلق بالاستخدام؛ وUniMorph يتعلق بأشكال الكلمات؛ وقوائم التكرار تتعلق بالبروز. المشكلة الهندسية لـ Lingua Mundi ليست «العثور على البيانات» — بل هي «دمج البيانات التي لم تُصمم أبدًا للدمج، دون التلاعب في عمليات الربط».

2.5 Why a map of meaning still matters in the age of large models

يجب طرح اعتراض منطقي بوضوح: إذا كانت النماذج اللغوية الكبيرة قادرة بالفعل على الترجمة وتعريف الكلمات والتفكير فيها، فلماذا نحتاج إلى إنشاء معجم منظم أصلاً؟ تتألف إجابة مؤلف Lingua Mundi، التي طورها في ورقة بحثه الصادرة في يونيو 2026 (القسم 3) وصقلها خلال الصيف، من ثلاثة أجزاء. أولًا، verifiability: يمكن لقاعدة البيانات المنظمة أن تظهر طريقة عملها — فكل رابط له مصدر وترخيص وتاريخ — في حين أن معرفة النموذج هي مزيج إحصائي غامض لا يمكن تدقيقه أو تصحيحه أو الاستشهاد به. ثانيًا، cost and access: لا يكلف الاستعلام عن قاعدة البيانات المحلية شيئًا ويعمل دون اتصال بالإنترنت، في حين أن كل استعلام عن النموذج يكلف طاقة أو مالًا أو كليهما؛ وقاعدة التصميم الدائمة للمؤلف هي «استعلامات بحثية خالية من الرموز» — سطح البحث المحلي API is سطح البحث [H] (مذكرة المشروع، 29 أغسطس 2026). ثالثًا، complementarity: جادلت الورقة البحثية الصادرة في يونيو 2026 — كفرضية، مع تلاقي عمليات تدقيق ثلاثة نماذج على نفس النتيجة — بأن النموذج المضغوط الذي يعمل على معرّفات المفاهيم بدلاً من الرموز الأولية يمكن أن يكون أكثر كفاءةً بكثير، وذلك تحديدًا لأن الخريطة المفاهيمية تقوم بالعمل الدلالي خارج الشبكة (انظر القسم 3). وسواء نجحت تلك الفرضية في التجارب أم لا، تظل الخريطة نفسها مفيدة للنماذج: باعتبارها ذاكرة خارجية يمكن الاستعلام عنها وتحديثها والاستشهاد بها دون الحاجة إلى إعادة التدريب.

وبالتالي، يمكن تلخيص الأصول الفكرية لـ Lingua Mundi في سطر واحد : إنه حلم «اللغة المشتركة» (interlingua)، الذي قصره WordNet على «المعجم»، وجعلته متعدد اللغات مشروع «المعجم المفتوح» (OMW)، وأضفى عليه الطابع القانوني حركة البيانات المفتوحة، وجعله شخصيًا حاجة أحد المترجمين إلى قاموس يعامل المعنى، وليس اللغة، باعتباره العنصر الذي يتم تصنيفه.

3 · The name, the thesis, and the seven-graph architecture (May–June 2026)

3.1 Naming

بحلول أواخر مايو 2026، كانت ملاحظات المؤلف ومواصفاته تستخدم العنوان المؤقت «المنصة المعجمية متعددة اللغات» [H] (نسخة رئيسية لمواصفات ماركداون بتاريخ 23 مايو 2026، /home/rex/Descargas/Phone backup/Download/). ظهر اسم Lingua Mundi — «لغة العالم» باللاتينية — ظهر لأول مرة في السجل المتاح على 1 June 2026، كعنوان لمخطوطة بحثية (انظر أدناه) [H] (سجلات المحادثات، 1 يونيو 2026؛ أقدم ظهور مؤكد في أرشيف المؤلف). الاسم ملائم: فالمشروع لا يدعي أنه يحتوي على العديد من اللغات، بل أنه about the one space of meaning ما تشترك فيه تلك اللغات.

3.2 A research thesis: meaning, not tokens

في الفترة ما بين مارس ويونيو 2026 تقريبًا، طور المؤلف — خلال محادثاته مع ChatGPT وClaude وDeepSeek — أطروحة بحثية حول الأسباب التي تجعل خريطة اللغة على مستوى المفاهيم قادرة على جعل تكنولوجيا اللغة أكثر كفاءة وسهولة في الوصول إليها بشكل جذري. الأطروحة، في الإطار العملي الذي طرحه المؤلف خلال المحادثة (مقتبسة حرفيًا من طلب الجدوى الذي قدمه في 18 يوليو 2026، حيث قام بلصق الوصف للمراجعة) [H]:

"Create a multilingual, open, machine-readable map of human language that separates: 1. Meaning · 2. Form · 3. Structure · 4. History · 5. Usage — into interoperable graphs. The long-term objective is to make language computable at the concept level rather than the token level. […] Modern NLP largely models: token → token. Lingua Mundi models: concept ↔ language."

الحجة الأساسية، الواردة في المخطوطة الصادرة في يونيو، هي أن نموذج اللغة يستهلك معظم طاقته على surface variation — حيث يعامل كلمات «dog» و«perro»، و«犬» على أنها ثلاثة أشياء غير مرتبطة ببعضها، في حين أنها شيء واحد بثلاثة أشكال [H] (المخطوطة V4، المقتبسة بالكامل في محادثة المراجعة بتاريخ 1 يونيو 2026). إذا كان بإمكان النموذج بدلاً من ذلك قراءة وكتابة concept sequences — مع قيام خريطة المفاهيم بالأعمال متعددة اللغات خارج الشبكة — فإن النموذج يمكن أن يكون أصغر حجمًا وأرخص تكلفة وقابلًا للتشغيل على أجهزة الكمبيوتر العادية.

3.3 Seven versions in one morning: the adversarial-collaboration method

اقترحت المخطوطة، التي تحمل عنوان Lingua Mundi: بنية تحتية دلالية لنماذج لغوية قائمة على المفاهيم، بنية seven-layer: رسم بياني للمفاهيم (معاني مستقلة عن اللغة، بحجم مستهدف يبلغ مليار )، ورسم بياني لمجموعات المعاني (يربط كلمات كل لغة بالمفاهيم)، و رسوم بيانية للمورفولوجيا، والاشتقاق، وعلم أصل الكلمات، والتوافق بين اللغات ، والاستخدام — جميعها مرتبطة بنظام معرف مشترك؛ بالإضافة إلى بنية نموذج قائمة على المفاهيم (نموذج تسلسلي على غرار Mamba يقرأ معرفات المفاهيم)، وتضمينات زائدية (كرة بوانكاريه) لمخطط المفاهيم، واسترجاع صريح للحقائق من المخطط، وميزانية مدققة تُظهر أن النظام بأكمله يتناسب مع أجهزة الكمبيوتر المحمولة العادية [H] (مخطوطة، 1 يونيو 2026).

ما يجعل هذه الحادثة جديرة بالملاحظة باعتبارها method — وموثقة بشكل استثنائي — هو أن المؤلف لم يكتب المخطوطة بمفرده. في صباح يوم 1 June 2026، أجرى سبع مراجعات متتالية (V1–V7) في أقل من نصف ساعة، مستخدمًا نموذجين بشكل تنافسي: قام DeepSeek بصياغة كل مراجعة بينما قام ChatGPT بمراجعة كل مسودة بدقة مراجع نظير معادٍ [H] (سجلات المحادثات، DeepSeek "Revisión y corrección del proyecto Lingua Mundi" و ChatGPT "Audit Feedback Lingua Mundi"، وكلاهما بتاريخ 1 يونيو 2026). تم الاحتفاظ بنصوص المراجعة حرفياً، وهي صريحة بشكل غير معتاد بشأن ما تم تصحيحه في كل جولة:

  • تم تصحيح العمليات الحسابية الخاصة بتخزين التضمين من نوع INT8 (خطأ في المعامل بمقدار

(خطأ في ميزانية التخزين بسبب وجود عنصرين)؛

  • تم حذف ادعاء تجريبي ملفق («تجريبيًّا، نجد أن…») و

استُبدلت بفرضية محددة بوضوح ومستندة إلى أبحاث سابقة؛

  • تم استبدال المقارنة مع نموذج افتراضي مستقبلي بـ

مقارنة مع نموذج حقيقي (DeepSeek-V3)؛

  • تم تضييق نطاق الادعاءات المتعلقة بالأداء الواردة في الملخص بشكل تدريجي؛
  • أُعيد تصنيف الادعاءات المتعلقة بالتحجيم غير المدعومة على أنها مشكلات بحثية مفتوحة؛ و
  • أعاد V7 صياغة المخطوطة، لتحويلها من ادعاء تجريبي إلى ادعاء صادق

ورقة موقف — خطة بحثية تتضمن تقييمًا صريحًا قابلًا للتفنيد الخطة (متانة عملية إزالة الغموض عن معاني الكلمات، عمليات الاستبعاد، خطوط الأساس).

وقد صنفت النتائج النهائية لعمليات التدقيق، المُحفوظة في السجلات، المخطوطة vision تقييمًا عاليًا، في حين صنفت empirical support تقييمًا منخفضًا بشكل ثابت — وكانت التوصية الختامية لآخر عملية تدقيق صريحةً: [H]:

"If I were advising the project, I would now pivot from paper-writing to implementation. The next valuable artifact is not V8. It is Lingua Mundi Prototype 0.1 … with: 100k–1M concepts, English only, concept tokenizer, concept reconstruction, TinyStories training run, direct comparison against token-Mamba. That experiment would answer the central question: does semantic compression preserve enough information to justify the bottleneck?"

وقد اتبع المؤلف تلك النصيحة. وهناك ثلاث ملاحظات بشأن هذه الحلقة تكتسي أهمية لفهم كل ما تلاها. أولاً، لم يكن idea أبداً العقبة — فقد كان لدى المؤلف، على حد تعبيره، رؤية حصلت في عمليات التدقيق على تقييم A−؛ بل كانت العقبة هي الأدلة، وقد أشارت عمليات التدقيق إلى ذلك سبع مرات. ثانيًا، أصبحت طريقة عمل المؤلف — التي تعتمد على استخدام نماذج متعددة للذكاء الاصطناعي كـ«متعاونين متنافسين»، والاحتفاظ بكل مسودة وكل عملية تدقيق، وتفضيل «التأهيل الصادق» على المبالغة الواثقة — أصبحت المعيار الدائم للاستوديو، وهي نفس الطريقة التي تظهر في قواعد التحقق الخاصة بـ [H]/[O]/[NV] في هذه الورقة (الملحق أ). ثالثًا، لم تختفِ البنية المكونة من سبع طبقات لتلك المخطوطة التي تعود إلى شهر يونيو عندما تحول المؤلف إلى مرحلة التنفيذ: بل أصبحت roadmap الخاص بالمشروع. إن Lingua Mundi الموجود اليوم (سبتمبر 2026) ينفذ الرسم البياني للمفاهيم، والرسم البياني لمجموعات المرادفات، واستيراد الصرف، وطبقات المجموعات النصية، وAPI؛ أما طبقات الاشتقاق، وعلم أصول الكلمات، والمراسلات، والاستخدام، فهي مراحل مدرجة صراحةً في نفس الخطة (الأقسام 5–6، 10.3) [H] (خريطة طريق المشروع، 29 أغسطس 2026).

4 · The platform takes shape (July–August 2026)

4.1 Feasibility: "can this be done with open-source components?"

في 18 July 2026، سأل المؤلف ChatGPT بصراحة تامة عما إذا كان من الممكن بناء هذه الرؤية باستخدام مكونات مجانية متوفرة بالفعل، وما الذي سيحتاجه لتطويرها [H] (المحادثة «Lingua Mundi Project Feasibility»، 2026-07-18، 00:44 بالتوقيت العالمي المنسق — مساء يوم 17 يوليو حسب التوقيت المركزي للمؤلف). تسجل المحادثة — والأسابيع التي تلت ذلك — التحول من ورقة بحثية إلى برنامج هندسي. اعتمد المشروع بيان المهمة الرسمي الذي أرفقه في تلك المحادثة للمراجعة (المقتبس في القسم 3.2)، وبدأ المؤلف في بناء هيكل الكود الفعلي: توجد ملفات المخطط لنموذج البيانات على القرص بتاريخ 17 يوليو 2026 [H] (لقطات للكود، يوليو 2026؛ انظر الملحق أ).

4.2 The engineering specification (24 July 2026)

في 24 July 2026، قام المؤلف بتجميع التصميم في مواصفات هندسية من 104 صفحة بعنوان المنصة المعجمية متعددة اللغات — المواصفات الهندسية، الإصدار 2.0، وعنوانها الفرعي "منقح وجاهز للإنتاج" [H] (PDF، /home/rex/، 24 يوليو 2026؛ نص مستخرج لهذه الورقة). وتُعد المواصفات بمثابة دستور المشروع، ويشرح محتواها معظم ما تم بناؤه لاحقًا:

  • The synset-centric principle. تشير الوثيقة إلى أن كل مصطلح

يجب أن يرتبط الكائن في النهاية بـ synset (معنى ما)، وأن تُنظم قاعدة البيانات وفقًا للمعاني وليس وفقًا للتهجئة. وقد نجحت في ذلك ومن الأمثلة على ذلك الكلمة bank، التي يجب أن تكون شكلاً سطحياً واحداً يتألف من عدة مجموعات مرادفات متميزة («ضفة النهر»، «مؤسسة مالية»، «الاعتماد على...») "شيء ما") — وليس أبدًا كتلة واحدة من المعاني غير المتمايزة [H].

  • Language tiers. تنقسم المواصفات المخطط لها إلى مستويين:

المستوى الأول عند الإطلاق — الإنجليزية، والإسبانية، والفرنسية، والبرتغالية، واليابانية، و اللغة الصينية الماندرين (المبسطة والتقليدية) — والمستوى 2 — الإيطالية، الكورية، والفيتنامية [H]. (المجموعة التي تم شحنها فعليًّا في تختلف قاعدة البيانات في نقطتين مثيرتين للاهتمام، تم توثيقهما في القسم 10: اللغات المتاحة هي الإنجليزية والإسبانية والفرنسية والألمانية والبرتغالية واليابانية — اللغتان الماندرين والإيطالية غير موجودتين، أما الألمانية فهي موجودة. والاستبدال هو لم يرد في أي مكان في السجلات الباقية [NV] أي تفسير لذلك، وهو اعتراف صريح بـ (مسألة لم تُحسم بعد تتعلق بمصدر القطعة.)

  • The data model. يوضح الفصل الخامس من المواصفات مخطط البيانات

بشكل عام، والنموذج الذي تم تضمينه في عملية الترحيل الأولى للمستودع هو مجموعة أساسية مكونة من أحد عشر طاولة تتوافق مع الحدس القائم على الكيانات الأربعة للنموذج الأولي لشهر ديسمبر 2025، الذي أصبح الآن رسميًّا: اللغات، الوحدات اللغوية، المعاني، المفاهيم (مجموعات المرادفات)، العلاقات، المصادر، مجموعات المعاني، والجداول الداعمة (انظر القسم 5).

  • A five-level alignment hierarchy. نظرًا لوجود ربط تلقائي ويدوي

تختلف درجات موثوقية تحويل الكلمات إلى مفاهيم، والمواصفات المقترحة خمسة مستويات لثقة المطابقة، بدءًا من الروابط الصريحة المذكورة في المصدر (مثل تعيينات OMW) وصولاً إلى التخمينات الاستدلالية — مع مراعاة القاعدة التي تنص على أن كل يحتوي الرابط المخزّن على مستوى الثقة الخاص به. وهذه هي الصيغة الناضجة لـ قاعدة «الاستدلال الصفري» في ديسمبر 2025: لا يُقصد بها الربط التلقائي no، بل labeled, honest متصل بـ [H].

  • A phase roadmap with gates. المراحل من 0 إلى 5، لكل منها معيار إنهاء،

من المخطط وعمليات ETL إلى API وصولاً إلى التطبيقات.

  • A risk register — بما في ذلك مرفق للنقد الذاتي يقترح أصل الكلمة

وطبقات CJKV/Unihan، مع التنبيه بشأن «الكلمات المتشابهة زوراً» بين اللغتين اليابانية والصينية (على سبيل المثال، كلمة 娘 التي تعني «ابنة» في اليابانية مقابل «أم» في الصينية؛ وكلمة 手紙 التي تعني «رسالة» مقابل "ورق التواليت") [H].

كما حددت المواصفات المكدس الذي سيقوم المشروع بتبسيطه لاحقًا: FastAPI، وPostgreSQL، ومحرك بحث (Meilisearch في المواصفات)، و واجهة ويب (Next.js). والجدير بالذكر أنه بحلول 13 أغسطس، كان المؤلف قد بدأ بالفعل في التشكيك في تلك المجموعة بنفسه (القسم 4.4).

4.3 The July journal: thinking about the semantic operating system

في نفس الأيام تقريبًا، تسجل مذكرات المؤلف الخاصة (knowledge project.txt، 85 كيلوبايت، تمت قراءتها بالكامل لإعداد هذه الورقة؛ الطابع الزمني للملف 18 يوليو 2026، جلسة عمل واحدة) سلسلة أفكار ذات صلة وأكثر خصوصية: محاولته التفكير في «الرسم البياني الدلالي الشامل» — طريقة مستقلة عن الترميز لتمثيل المعنى تعمل عبر لغات البرمجة ونظرية الموسيقى والكيمياء و اللغة الطبيعية (مشروع منفصل أطلق عليه اسم USG) [H] (المذكرات، يوليو 2026). المقطع الأكثر صلة بـ «لينغوا-موندي» في اليوميات (الأسطر 2563– 2587) هو تأملاته حول ما قد يعنيه ترجمة one semantic object إلى ثلاث لغات في آن واحد — وهي نفس الفكرة البديهية لـ cat · gato · 猫، التي كُتبت كتمرين للتفكير في الواجهات بدلاً من اللغات [H]. ومن المثير للاهتمام أن المثال العملي الذي قدمته المجلة نفسها لـ«لغة» شرحها هو مخطط LanguageCreate الخاص بقاعدة كود Lingua Mundi — وهو دليل على أن بحلول منتصف يوليو كان الخيطان (رؤية البحث والكود الفعلي) قد تداخلتا بالفعل في ذهنه [H].

4.4 August: from schema to running system

في أغسطس 2026، تحولت Lingua Mundi إلى system. وتُظهر السجلات المتبقية سلسلة متتالية من القرارات، ترك كل منها أثره:

  • 1–8 August. استكشف المؤلف الرسم البياني وتمثيل المعرفة

خيارات ("JSON في شكل رسم بياني"، 29 يوليو؛ أفكار لتحقيق الدخل من API، 7–12 أغسطس) و— وهو أمر بالغ الأهمية بالنسبة للتصميم النهائي — سأل عما إذا كان API "يحتاج حقًا" إلى مجموعة كبيرة (القسم 4.5) [H].

  • 11 August.: قام باستكشاف إمكانية دمج Maya languages في لغة «لينغوا»

Mundi ("تكامل Lingua Mundi Maya")، في إطار استمرار الاهتمام بـ اللغات الأصلية المكسيكية التي ظهرت لأول مرة في رسالة [H] الصادرة في ديسمبر 2025.

  • 13 August.: حسمت محادثتان حول التصميم شكل الـ

المنتج: "مجموعة التقنيات اللغوية API" (انظر 4.5) و"التفاعل الدلالي" "Layer"، التي رسمت الخطوط العريضة للواجهة المستقبلية بين طبقة المعرفة والتطبيقات [H].

  • 19–25 August. قام بتصنيع جهاز Japanese demonstration: جهاز صغير الحجم

قاعدة بيانات غير متصلة بالإنترنت (SQLite) تتضمن بيانات القاموس الياباني بحيث يتم يمكن لمس التصميم الموجه للمفاهيم واستعلامه وعرضه على الآخرين ("إنشاء نسخة تجريبية باللغة اليابانية"؛ وملفات lingua-mundi-jpn.sqlite الناتجة هي (محفوظ على القرص) [H]. كان لهذا المشروع السريع موعد نهائي محدد و الحضور: كان من المقرر أن يحضر ممثلو Japan Foundation إلى الجامعة في الأسبوع التالي، والمقطع التوضيحي (مع الفوريغانا (المحرر الذي تم تغيير اسمه إلى Shikibu في نفس الفترة) تم إعداده على النحو التالي: ملف معلومات عن المنتج تم تركه خلال تلك الزيارة [H] (سجل المحادثة، (19–25 أغسطس 2026).

  • 23 August. عندما طُلب منه تقديم وصف من فقرة واحدة لهذا المفهوم، قال

تلقى ملخصًا يتطابق مع ما تظهره السجلات أنه يقوم بإنشائه: "أ بنية لغوية قابلة للقراءة آليًّا للغات البشرية… بل فإن تطبيق Lingua Mundi ليس مجرد قاموس ياباني أو تطبيق ترجمة، بل هو "تهدف إلى أن تصبح طبقة ذكاء لغوي عام" [H] — وفي نفس المحادثة، ورد وصف بـ «technical» يحدد المكدس الذي كان مخططًا له آنذاك (PostgreSQL، Apache AGE لاستعلامات الرسم البياني، OpenSearch للاسترجاع، FastAPI (مثل API) أن قياسات الشهر التالي سيجعل ذلك غير ضروري (القسم 4.5، القسم 6) [H].

  • 24 August onward. انتقلت قاعدة الكود إلى مقرها الدائم بصفتها

مستودع مناسب ("LinguaMundi") مع اللقطة اليومية للنسخة الاحتياطية GitHub سجل بدءًا من 27 أغسطس [H] (لقطات من المستودع؛ انظر الملحق أ).

4.5 The lean-stack decision that shaped everything

تم الاحتفاظ حرفياً بالقرار التقني الأكثر أهمية في شهر أغسطس. في 13 August 2026، قام المؤلف بلصق مجموعة التقنيات التي خطط لها بنفسه — FastAPI، Polars، DuckDB، PostgreSQL، Apache AGE (امتداد للرسم البياني)، OpenSearch، Redis، Celery، React، وDocker — وسأل: «هل يحتاج API اللغوي حقًّا إلى هذه المجموعة إذا كان يعمل بالفعل على Postgres؟» [H] (المحادثة «مجموعة التقنيات اللغوية API»، 13 أغسطس 2026).

كان الجواب الذي تلقّاه — واعتمده — هو أنه لم تكن هناك حاجة إلى أيّ من ذلك تقريبًا حتى ذلك الحين: فـ PostgreSQL وحده كان كافيًّا لتقديم بيانات القاموس العلائقية، والكانجي، وطرق النطق، وتصريفات الأفعال، والترجمات، والبحث عن النص الكامل، وحتى ، وكانت القاعدة الصحيحة هي «قيود PostgreSQL → إضافة التكنولوجيا»، وليس «المرحلة 3 تنص على قاعدة بيانات الرسوم البيانية → تثبيت قاعدة بيانات الرسوم البيانية» [H] (نفس المحادثة). وخلصت النصيحة إلى: «ميزة API التنافسية ليست البنية التحتية. إنها نموذج البيانات اللغوية و التحويلات التي قمت ببنائها فوق البيانات» [H].

هذا القرار — قاعدة بيانات علائقية واحدة، وإطار عمل API واحد، ولا شيء آخر حتى تقتضي الحاجة — هو السلف المباشر لهيكلية الأداء الموصوفة في القسمين 6 و7. وعندما نمت قاعدة البيانات، في سبتمبر 2026، لتصل إلى 1.6 مليون معنى للكلمات وتباطأت الاستعلامات البسيطة لتستغرق دقائق، لم يلجأ المؤلف إلى قاعدة بيانات رسومية أو محرك بحث: بل لجأ إلى PostgreSQL materialized views — نمط «الخبز، لا إعادة الاشتقاق» — وخفض أبطأ الاستعلامات من أكثر من دقيقة إلى حوالي ثانية واحدة على أجهزة تعود إلى عام 2014 (القسم 7). كان القرار الذي اتُخذ في أغسطس بالحفاظ على البساطة هو ما جعل عملية التحسين التي جرت في سبتمبر ضرورية و ممكنة.

4.6 The human-AI development method, in practice

لا بد أن قارئ هذه القصة قد لاحظ أن كل معلم بارز تقريبًا يصاحبه سجل محادثة: فالمؤلف يفكر من خلال الحوار. وبحلول أغسطس 2026، استقرت منهجيته لتصبح شيئًا يمكن وصفه بدقة استنادًا إلى السجل:

  1. The human sets the direction and owns the data. كل طلب في

السجلات مملوكة للمؤلف؛ وكل ملف موجود على جهازه؛ وكل قرار — بما في ذلك التغييرات المفاجئة مثل مسألة «لين-ستاك» — هي من صنعه.

  1. تم استخدام AI models are used as specialized collaborators. ChatGPT

بشكل مكثف في مجالات البحث والنقد المعماري والتدقيق؛ و«ديبسيك» من أجل دورات الصياغة والمراجعة و(لاحقًا) باعتبارها البنية الأساسية التي تقوم عليها نظام التشغيل الآلي الخاص بالاستوديو؛ و«كلود» للذاكرة طويلة المدى والمشروع السياق (بدأت قاعدة المعرفة الخاصة بالاستوديو كملف تم تصديره من ذاكرة «كلود»).

  1. يتم تصدير محادثات The record is kept. (أرشيف المؤلف)

(تحتوي على الآلاف)، ويتم التقاط لقطة من الكود، و— اعتبارًا من 26 أغسطس 2026 — كل يتم تسجيل الجلسة العملية في قاعدة المعرفة Obsidian باستخدام المقدمة، والتواريخ، وحالة التحقق (القسم 9). هذه الورقة هي ولم يكن ذلك ممكناً إلا بفضل عادة حفظ السجلات تلك.

  1. Adversarial review is built in. مراجعة النسخة الأولى (V1) إلى النسخة السابعة (V7) من مخطوطة يونيو

أصبحت حلقة (القسم 3.3) ممارسة متبعة: حيث يتم تدقيق المسودات من قبل نموذج مختلف عن ذلك الذي كُتبت به، ويتم الاحتفاظ بتقارير التدقيق في ملف.

سواء أطلقنا على هذا «ترميز الأجواء»، أو «التطوير بمساعدة الذكاء الاصطناعي»، أو ببساطة «استخدام الأدوات»، فإن التسمية الصادقة مهمة للتسجيل: Lingua Mundi هو مشروع من تأليف بشري تم بناؤه في إطار تعاون متعمد وموثق مع مساعدين من الذكاء الاصطناعي، وهذه الورقة (التي هي في حد ذاتها مسودة أنشأها الذكاء الاصطناعي تحت توجيه المؤلف، وفقًا للإشعار الوارد في مقدمة المنشور) هي نتاج لنفس المنهجية.

5 · Design: the linguistic and mathematical principles of the model

يشرح هذا القسم، بلغة بسيطة، المفاهيم التي تحدد كيفية قيام Lingua Mundi بتخزين اللغات. يمكن للقراء الراغبين في الاطلاع على history الانتقال مباشرة إلى القسم 6؛ أما القراء الراغبون في الاطلاع على formulas and schema فسيجدونها هنا وفي الملحق أ.

5.1 Four kinds of objects, one space of meanings

ينبثق نموذج البيانات مباشرةً من أنواع الكيانات الأربعة في مسار العمل الخاص بشهر ديسمبر 2025 (القسم 1.2) ومن الجداول الأحد عشر [H] الواردة في المواصفات الخاصة بشهر يوليو 2026. في شكله النهائي، يخزن النموذج خمسة أنواع أساسية من العناصر (تم التحقق منها مقابل المخطط الفعلي، سبتمبر 2026 [H]):

  • Language — صف واحد لكل لغة بشرية، مرتبة حسب رمز ISO 639-3 الخاص بها

رمز مكون من ثلاثة أحرف (eng، spa، jpn، …)، مع اسمه، واسمه الذاتي (الـ الاسم الذي يستخدمه المتحدثون)، وعائلة اللغة، ونظام الكتابة. إضافة تتمثل عملية إضافة اللغة إلى النظام بأكمله، بحكم تصميمها، في إضافة صف واحد بالإضافة إلى مجموعات البيانات: لا توجد جداول خاصة بكل لغة في أي مكان [H] (ملاحظة بشأن الكود والمشروع، (29 أغسطس 2026). هذه الخاصية «المستقلة عن اللغة» هي خاصية على مستوى المخطط تجسيد لفكرة «اللغة المشتركة» (القسم 2.1).

  • Lexeme — شكل لفظي في لغة معينة: السلسلة cat،

السلسلة gato، والسلسلة . تنتمي الوحدة اللغوية إلى لغة واحدة فقط وتشير إلى فئة النحو.

  • Senseone meaning of one lexeme as recorded by one dictionary:

كلمة "cat" بمعنى الحيوان من WordNet، وكلمة "cat" بمعنى عازف الجاز من WordNet، "cat" بمعنى "حطب عيد الميلاد" المستمد من Wiktionary. وعادةً ما تحتوي الوحدة اللغوية على بمعانٍ عديدة — هكذا يمثل النموذج polysemy (كلمة واحدة، (معاني عديدة) دون أن يخلط بين المعاني أبدًا. قد يكون المعنى كذا أو قد لا يكون مرتبطًا بمفهوم ما بعد؛ والرابط هو الحقل concept_id، وهي nullable by design — يتم الاحتفاظ بالمعنى غير المرتبط وعرضه على النحو التالي: يتيم بدلاً من أن يتم تخمينه ليشغل المكان [H] (المخطط؛ ملاحظات خط الأنابيب، (ديسمبر 2025).

  • Concept — معنى مشترك بين اللغات: المفهوم

"القط المنزلي" المُعرَّف بواسطة معرّف URI لمجموعة المصطلحات Princeton WordNet princeton-wordnet:02121620-n [H] (قاعدة بيانات حية). المفاهيم موجودة في يتم إجراء المطابقة متعددة اللغات: الإسبانية gato (أحد معانيها)، يمكن أن تكون جميعها: cat باللغة الإنجليزية، وchat باللغة الفرنسية، وKatze باللغة الألمانية، و باللغة اليابانية تشير جميعها إلى نفس المفهوم — فهي «نجمة واحدة» لها أسماء عديدة (القسم 8). يُعد جدول المفاهيم قلب النظام، وفي تحتوي قاعدة البيانات الحالية على 96,434 صفًا [H] (قياس، 6–7 سبتمبر (2026).

  • Relation — علاقة محددة النوع وموجهة بين مفهومين،

على سبيل المثال، القطة المنزلية IS_A من فصيلة القطط، أو القط IS_A من فصيلة آكلات اللحوم. العلاقات تتضمن مسندًا، ومستوى ثقة، ومصدرًا. وتحتوي قاعدة البيانات الحالية على 171,672 منها من طراز [H] (القياس، 6–7 سبتمبر 2026).

وتحيط بهذه المجموعات الخمس آلية تتبع المصدر — وهي جدول source يسجل مصدر كل مجموعة بيانات، وترخيصها، وعنوان URL الخاص بها (بحيث لا يظل أي ادعاء في قاعدة البيانات دون نسبته إلى مصدره)، وجداول مجموعات المعاني التي تربط بتنسيق OMW، وجداول داعمة للكانجي وقراءاته [H] (المخطط، سبتمبر 2026).

5.2 The alignment problem, and why it is not faked

المشكلة الفكرية المركزية لخريطة المعنى متعددة اللغات هي alignment: تحديد أن المعنى this للكلمة this في اللغة this هو the same meaning باعتباره المعنى that للكلمة that في اللغة that. إجابة Lingua Mundi، الموروثة من تصميم OMW، هي not تحديد ذلك من جديد: يحدد مشروع OMW بالفعل، لكل لغة، أي من مجموعات المرادفات الخاصة به تتوافق مع مجموعات المرادفات Princeton WordNet، لذا تستورد قاعدة البيانات تلك التعيينات الصريحة باعتبارها طبقة المطابقة الأساسية [H] (Bond & Foster, 2013؛ كود الاستيراد). وفي حالة عدم وجود تخطيط صريح، يطبق النظام التسلسل الهرمي للثقة ذي المستويات الخمسة (من مواصفات يوليو 2026): تحتل الروابط الصريحة المذكورة في المصدر المرتبة الأعلى؛ بينما تحتل الروابط المستنتجة المرتبة الأدنى ويتم تخزينها with their level — ولا يتم ترقيتها أبدًا بصمت إلى «حقيقة» [H] (المواصفات، 24 يوليو 2026). هذه هي الصيغة الناضجة للقاعدة التي وضعها المؤلف في ديسمبر وكتبها بخط يده في كود خط الأنابيب الخاص به: «صفر استدلالات». لا يعني ذلك أن النظام لا يخمن أبدًا؛ بل إن التخمينات تُصنف على أنها تخمينات، وهذا ما يجعل قاعدة البيانات honest enough to grow: التخمين الخاطئ الذي يُصنف على أنه تخمين يمكن العثور عليه وتصحيحه؛ أما التخمين الخاطئ المخزّن كحقيقة فيُفسد كل شيء في المراحل اللاحقة.

وتحكم نفس الفلسفة درجة التفصيل في تصنيف اللغات. فمعيار ISO 639-3 يميز بين اللغات الحقيقية، وليس الحدود السياسية أو اختلافات أنظمة الكتابة. وقد أشار المؤلف إلى حالة واحدة صعبة حقًّا قد تطرأ في المستقبل: اللغة الكورية، التي يغطي رمز ISO الوحيد الخاص بها kor كلاً من المعيار الخاص بجمهورية كوريا والمعيار الخاص بجمهورية كوريا الشعبية الديمقراطية. وتُظهر السجلات المتبقية أن هذه الحالة تم الإشارة إليها على أنها قرار نمذجة مفتوح [H] (سجل الجلسة، 7 سبتمبر 2026) — وهو مثال على مبدأ المخطط الذي يقضي بتخزين languages، وليس الإعدادات المحلية، وتذكير بأن بيانات اللغات في العالم الحقيقي لا تتناسب مع الصناديق المنظمة التي تحتوي على صف واحد لكل لغة.

5.3 The graph: taxonomies, neighborhoods, and the long tail

بمجرد مواءمة الحواس مع المفاهيم وربط المفاهيم بالعلاقات، تصبح قاعدة البيانات is عبارة عن رسم بياني: 96,434 عقدة معنى تربطها 171,672 حافة مصنفة، وأكبر مكون فيها هو التصنيف is-a الموروث من WordNet (الثدييات → آكلات اللحوم → القطط → القط المنزلي)، والتي تم إثرائها بعلاقات «مثال لـ» و «جزء من» وعلاقات عبر اللغات [H] (قياس، سبتمبر 2026؛ المخطط). وهناك ثلاث حقائق رياضية حول هذه الرسوم البيانية تشكل واجهة المستخدم والهندسة:

  1. Taxonomies are trees of meaning. لأن الوالدين لكل مفهوم هما

كما هو معروف، يمكن للنظام الإجابة على السؤال «ما نوع هذا؟» (التسلق) و "ما هي أنواع هذا؟" (النزول) — العمليات الكامنة وراء عدسة التصنيف في الواجهة (القسم 8).

  1. Degree distributions are Zipfian. الرسوم البيانية اللغوية الحقيقية هي

scale-free-ish: هناك بعض المفاهيم (مثل «حيوان»، «شخص»، «شيء») التي أحياء ضخمة، في حين أن معظم المفاهيم لا تضم سوى عدد قليل من الجيران. هذا «الذيل الطويل» هو نفس الشكل الإحصائي Zipf الذي اشتهر قياسه في تكرار الكلمات (Zipf, 1949): يمثل عدد قليل من الكلمات الجزء الأكبر الاستخدام. وينتج عن ذلك أمران متعلقان بالتصميم: يجب أن يكون هناك ترتيب (لا يمكنك (عرض 30,000 معنى لطلب بحث واحد)، ويجب أن يكون الترتيب meaningful — وبالتالي، تقوم الواجهة بترتيب المفاهيم وفقًا لمؤشر sky brightness، وهو مؤشرًا على مدى «أهمية» المعنى أو مدى ارتباطه بالمعاني الأخرى (القسم 5.5).

  1. Shortest paths are the natural translation route. إذا كان لدينا مفهومان،

يمكن البحث في الرسم البياني عن مسار متصل — العملية الكامنة وراء ذلك أداة السكستانت في الواجهة (القسم 8.4)، والتي تم تنفيذها كـ... محدودة البحث ثنائي الاتجاه بالاتساع عبر التصنيف (≤ 10 قفزات، 25 جارًا لكل عقدة، مع استجابة في أجزاء من الألف من الثانية) [H] (رمز، مباشر) القياس، سبتمبر 2026).

5.4 Zipf and the shape of dictionaries

Schematic Zipfian long tail: the head is baked, the tail stays relationalthe headfew words, most usage —baked into ranking viewsthe long tailrare words stay in therelational tablesschematic — Zipf's law: frequency ∝ 1/rank (Zipf, 1949)
Schematic only — it illustrates the design consequence of Zipf's law described in Section 5.4.

يستحق قانون Zipf إشارة صريحة لأنه يفسر بهدوء بنية الأداء بأكملها. فإذا كانت تكرارات الكلمات تتبع قانون القوة، فإن أي قاموس يهيمن عليه «رأس قصير» من الكلمات الشائعة و«ذيل طويل بشكل هائل» من الكلمات النادرة. بل إن المخطوطة الصادرة في يونيو 2026 استنتجت حسابًا للتغطية قائمًا على Zipf لمفردات المفاهيم [H] (تدقيق المخطوطة V7، 1 يونيو 2026). بالنسبة لقاعدة البيانات، يعني الذيل الطويل ما يلي: معظم rows هي كلمات نادرة، ومعظم queries هي كلمات شائعة، وأي استعلام يجب أن يقوم بمسح الجدول بأكمله — بما في ذلك جميع الكلمات النادرة — يكون أبطأ بشكل كارثي من الاستعلام الذي يمكن أن يبدأ من ترتيب محسوب مسبقًا. نمط العرض المادي في القسم 7 هو، في جوهره، طريقة لتحويل قانون Zipf من عدو للأداء إلى أداة تصميم: قم بتحضير head (الترتيب، الكلمات الأكثر شيوعًا لكل مفهوم) مرة واحدة، ودع tail يبقى في الجداول العلائقية لعمليات البحث النادرة التي تحتاج إليه فعليًّا.

5.5 Sky brightness: one ranking to rule the map

الاستعارة التنظيمية للواجهة هي star map (القسم 8)، و تستند هذه الاستعارة إلى عملية حسابية فعلية. يُخصص لكل مفهوم brightness — وهو مقدار رقمي يُستخدم لفرز السماء — مستمد من مكانته في الرسم البياني متعدد اللغات: عدد اللغات التي ترتبط بها كلمات، مدى ثراء مجموعات الكلمات تلك، ومدى بروز المفهوم في التصنيف. تُجسّد قاعدة البيانات ذلك في شكل concept_sky_rank، وهو ترتيب محسوب مسبقًا لجميع المفاهيم التي يزيد عددها عن 96,000، بحيث لا تتطلب عبارة «أعطني السماء» لا يتطلب أبدًا فرز مليون صف في وقت الطلب [H] (النصوص و القياس، 6 سبتمبر 2026). عرضان مصاحبان — concept_lang_rank (التصنيفات لكل لغة) وconcept_word_rank (أهم أربع كلمات لكل مفهوم في كل لغة، «مُعدة مسبقًا» بحيث يكون إثراء نجمة بكلماتها بمثابة عملية بحث، وليس عملية ربط بين أكثر من 1.6 مليون معنى) — تكمل نظام التصنيف [H] (نصوص برمجية، 6 سبتمبر 2026؛ أعداد الصفوف في الملحق أ).

5.6 Bounded work: the game-designer's discipline applied to a database

مبدأ التصميم الأخير مستمد من ألعاب الفيديو. فاللعبة تعرض إطارًا واحدًا في غضون 16 مللي ثانية مهما كان حجم العالم فيها: فهي تحدد حجم العمل لكل إطار. ويطبق Lingua Mundi نفس المنهج — حجم عمل محدد لكل استعلام في مساحة بيانات غير محدودة — لأن أجهزته تتطلب ذلك (جهاز كمبيوتر محمول من عام 2014؛ القسم 9). لا يجوز لأي طلب مسح المجموعة الكاملة؛ يجب أن يبدأ كل طلب من فهرس أو عرض مُعد مسبقًا؛ يجب ألا تُعرض الواجهة إلا عندما يقوم المستخدم بعمل ما (معدل خمول وحدة المعالجة المركزية ≈ 0%)؛ ويتم تقسيم النتائج إلى صفحات بنسق نوافذ ثابتة. يوضح القسمان 6 و7 العوائق الثلاثة التي واجهتها هذه المعايير في الأداء وكيف تم حل كل منها بنفس النمط: التحضير المسبق، لا إعادة الاشتقاق.

6 · Architecture: importing the world, serving the map

6.1 The pipeline: one registry, twenty-plus importers

تدخل كل مجموعة بيانات إلى Lingua Mundi عبر importer — وهو برنامج يستطيع قراءة تنسيق خارجي واحد وتحويله إلى المخطط القياسي. توجد القائمة المرجعية الوحيدة للمستوردين في ملف واحد، وهو سجل المستوردين؛ وبحلول سبتمبر 2026، كان يحتوي على أكثر من عشرين مكونًا إضافيًّا مسجَّلًا يغطي: Princeton WordNet وWordNet باللغة الإنجليزية، وOpen Multilingual Wordnet (OMW)، وWiktionary ومشتقته القابلة للقراءة آليًّا kaikki، وWikidata، وUniMorph وJ-UniMorph (علم الصرف)، وقواعد البيانات الشجرية Universal Dependencies (UD)، OpenThesaurus (المرادفات الألمانية)، وقاموس النطق التابع لجامعة كارنيجي ميلون ,، وIDS character decompositions، وCLICS للبيانات عبر اللغات، وقوائم تكرار الكلمات، والمجموعة اليابانية — JMdict، EJDict، KANJIDIC2 [H] (سجل المستوردين وملاحظات المشروع، تم الوصول إليها في 6–7 سبتمبر 2026). (تحذير واحد من أجل الدقة: يوجد مجلد لمجموعات النصوص المتوازية OPUS في دليل المستوردين، لكنه مجلد فارغ وغير مسجل في انتظار طبقة الجمل في خارطة الطريق — وقد أُدرج هنا من باب الصدق، وليس كمصدر [H] (قائمة الرموز، 6–7 سبتمبر 2026).) يقوم كل مستورد بتسجيل لغاته المستهدفة وفقًا لنفس رموز ISO، وهو ما يجعل المخطط غير مرتبط بلغة معينة في الممارسة العملية، وليس فقط من الناحية النظرية [H] (رمز).

تخضع عمليات الاستيراد لإشراف خط أنابيب يقوم بتشغيل كل مصدر، ويسجل مهمة الاستيراد، ويُبلغ عن نجاحها — وهو أمر بالغ الأهمية بالنسبة للفقرة 7. بعد كل عملية استيراد، يقوم بتحديث عروض التصنيف (القسم 5.5) بحيث تعكس «السماء» دائمًا أحدث البيانات [H] (نصوص برمجية، سبتمبر 2026).

6.2 The corpus today (measured)

Lexemes per live language (rounded, September 2026 audit)Japanese · jpn345k lexemesEnglish · eng271k lexemesGerman · deu176k lexemesSpanish · spa152k lexemesFrench · fra149k lexemesPortuguese · por145k lexemeslexemes in thousands (enrichment audit, rounded — Section 6.2)
Lexemes per live language (enrichment audit, 6 September 2026; rounded). Full SQL counts in Section 6.2.

قياس مباشر بواسطة SQL لقاعدة البيانات الحية في 6 سبتمبر 2026 الساعة 23:02 بتوقيت وسط أمريكا، وأعيد التحقق منه في 7 سبتمبر 2026 (كلا القيمتين متطابقتان) [H]:

TableRows
concepts (meanings)96,434
lexemes (word forms)1,238,383
senses (word-dictionary meanings)1,608,018
relations (typed concept links)171,672
languages (live)6 — eng, spa, fra, deu, por, jpn

الوزن المعجمي لكل لغة (تدقيق الإثراء، 6 سبتمبر 2026 [H]):

LanguageLexemesSenses
Japanese (jpn)≈ 345,000≈ 528,000
English (eng)≈ 271,000≈ 393,000
German (deu)≈ 176,000≈ 203,000
Spanish (spa)≈ 152,000≈ 167,000
French (fra)≈ 149,000≈ 157,000
Portuguese (por)≈ 145,000≈ 160,000

يجب الإشارة إلى تحفظين مهمين بخصوص هذه الأرقام. أولاً، الأرقام الخاصة بكل لغة تقريبية (تم تقريبها من نتائج التدقيق)؛ أما أرقام SQL على مستوى الجدول فهي دقيقة في لحظة قياسها. ثانياً، المجموعة النصية هي layered: بعض مجموعات البيانات (جميع Wiktionary وقوائم تكرار الكلمات) تم تعيين حد أقصى لها عمدًا بمقدار 50,000 صف لكل عملية استيراد، مع توفير تغطية أعمق من خلال مصادر أخرى ، وهذا الحد الأقصى موثق وليس مخفيًا [H] (التدقيق، 6 سبتمبر 2026). يوضح القسم 7 ما يحدث عندما تم توثيق حد أقصى مماثل not كمخاطرة.

6.3 The API surface

يعرض النظام واجهة HTTP API (FastAPI) صغيرة تم تجميدها عمدًا، حيث تم توثيق أن واجهة «المرحلة 0» منها لم تتعطل أبدًا مع ظهور مراحل جديدة [H] (ملاحظة المشروع، 29 أغسطس 2026). نقاط النهاية، التي تم التحقق منها فعليًّا في سبتمبر 2026 [H]:

  • /languages — سرد اللغات الحية وبياناتها الوصفية؛
  • /lexemes و /concepts — استعلامات القوائم المقسمة إلى صفحات (الحد/الإزاحة، محددة السعة

بسعر 1,000 لكل صفحة بعد أن كشفت عملية تدقيق أُجريت في شهري أغسطس وسبتمبر أنها غير مُجلدة)؛

  • /analyze — التحليل الصرفي/المعجمي لكلمة ما؛
  • /kanji و /lookup — عمليات البحث عن حروف الكانجي اليابانية والمفردات في القاموس؛
  • /graph/sky — موجز خريطة النجوم: مفاهيم مرتبة حسب سطوع السماء، مع

معلمات البحث (query، lang)، العمق (skip/مستوى)، وما إذا كان إرفاق كلمات العضو (words)، و taxonomy lens (anchor، (lens=up|down) التي تتسلق أو تنزل شجرة is-a انطلاقًا من نقطة معينة المفهوم؛

  • /graph/star/{id} — نجمة واحدة كاملة: عدد الكلمات المكونة لها لكل لغة و

المفاهيم المجاورة لها، وكلاهما مقسم إلى صفحات؛

  • /graph/path — البحث في الرسم البياني المحدود (القسم 5.3) بين اثنين من

المفاهيم؛

  • /graph/word — «عدسة الكلمات»: عند إدخال كلمة ولغة، فإن المفاهيم

ما ترتبط به حواسها حاليًا.

يتم ضغط جميع الردود (gzip)، وقد صُمم كل استعلام ليتم تنفيذه انطلاقًا من فهرس أو عرض مادي — وفقًا لقاعدة «العمل المحدود» الواردة في القسم 5.6 [H] (الكود والعناوين الحية، سبتمبر 2026).

6.4 Why the design is language-agnostic in the database, not just on paper

يمكن للقارئ الآن رؤية الحلقة بأكملها. تظهر لغة جديدة على شكل صف واحد language (مثل: اللغة الماندرين، الرمز cmn) بالإضافة إلى مجموعات البيانات المسجلة (شبكة كلمات OMW للغة الماندرين، وقاعدة بيانات الأشجار اللغوية UD للغة الماندرين). يقوم المستوردون بكتابة وحداتها اللغوية، ومعانيها، و— في حالة وجود OMW أو خرائط أخرى صريحة — روابط «المعنى→المفهوم». يتم إعادة حساب تصنيفات العروض؛ ويكتسب الفضاء لغة جديدة؛ دون تغيير في الجداول؛ دون ترحيل؛ ودون حالات خاصة في API. أما العائلة التالية المخطط لها على هذا المسار بالضبط — الماندرين، والكانتونية، والكورية، والفيتنامية — فهي موصوفة في القسم 10.3، حيث يتم تسجيل استطلاع توفر البيانات الذي سيحدد جدولها الزمني في [H] (سجل الجلسة، 7 سبتمبر 2026). إن وعد التصميم — «إضافة لغات إلى ما لا نهاية» — ليس مجرد دعاية تسويقية: بل هو النتيجة المباشرة للمخطط.

7 · Two infrastructure lessons: bake-don't-re-derive, and fail-loud

Query latency before and after the materialized-view patterndefault sky8.6s0.25ssky · 1,000 stars + words>60s1.1sper-request ranking0.5s0.02s
Query latency before and after the "bake, don't re-derive" materialized views (warm cache; 2014-era laptop).

يواجه كل مشروع قاعدة بيانات في نهاية المطاف عوائق في الأداء. وقد واجه مشروع Lingua Mundi ثلاثة منها في غضون أسبوع واحد — ليكتشف بعد ذلك أن المشكلة الأكثر إثارة للاهتمام لم تكن السرعة، بل الصمت. يروي هذا القسم القصةين معًا، لأنهما يشكلان معًا أهم الدروس الهندسية القابلة للتطبيق من هذا المشروع.

7.1 The pattern: bake, don't re-derive

القاعدة التي حلت مشكلة الحواجز الثلاثة للأداء بسيطة بما يكفي لتلخيصها في جملة واحدة: عندما تحتاج العديد من الاستعلامات إلى نفس العملية الحسابية المكلفة، قم بحسابها مرة واحدة، واحفظ النتيجة، وحافظ على تحديثها — ولا تقم بإعادة حسابها لكل استعلام. من منظور قواعد البيانات، يستخدم Lingua Mundi طرق العرض المادية PostgreSQL: جداول محسوبة مسبقًا تعمل كفهارس مليئة بالإجابات.

  • Wall 1 — ranking the sky. في الأصل، طلب خريطة النجوم الافتراضية

أجبرت قاعدة البيانات على إعادة ترتيب المجموعة الكاملة per request: حول 8.6 ثانية في كل مرة على الكمبيوتر المحمول الخاص بالمشروع الذي يعود إلى عام 2014. وقد أدى هذا الإصلاح إلى تثبيت تصنيفها إلى concept_sky_rank و concept_lang_rank (94,498 و (218,120 صفًا محسوبًا مسبقًا)، وبعد ذلك قدمت «السماء» الافتراضية الإجابة في ~0.25 ثانية، أما الطلبات الأعمق فتستغرق عشرات الميلي ثانية [H] (قيمة مقاسة، (6 سبتمبر 2026).

  • Wall 2 — naming the stars. يطمح إلى السماء with its words

المرفق (أكثر الكلمات استخدامًا لكل مفهوم في كل لغة) استلزم ربطًا عبر 1.6 مليون عملية استرجاع في كل طلب؛ وعند 1,000 نجمة، استغرق الاستعلام أكثر من دقيقة — حالة مرضية. وقد جمد التصحيح الكلمات نفسها: يقوم concept_word_rank بحساب الكلمات الأربع الأولى مسبقًا لكل مفهوم لكل اللغة (338,378 صفًا عند الإنشاء)، مما حوّل عملية ربط استغرقت أكثر من دقيقة إلى ~1.1 ثانية للبحث، ووقت العرض الافتراضي يبلغ ~0.25 ثانية [H] (قيمة مقاسة، (6 سبتمبر 2026).

  • Wall 3 — hierarchy and pagination. الصعود والنزول من

التصنيف (تحريك العدسة لأعلى/لأسفل) وتصفح النوافذ الثابتة للنجوم كانا تم حلها باستخدام المسندات القياسية، وترتيب الفهرس، وتقسيم الصفحات الثابت ويندوز (استعلامات بنمط DISTINCT ON) بدلاً من قاعدة بيانات الرسوم البيانية — نتيجة قرار «المجموعة المقتضبة» الصادر في أغسطس (القسم 4.5) [H] (الرمز والقياسات، 6 سبتمبر 2026).

بعد كل عملية استيراد، يتم تحديث العروض تلقائيًا، لذا فإن مصطلح «baked» لا يعني أبدًا «stale» [H] (البرامج النصية). هذا النمط بأكمله هو مثال أصلي من قاعدة البيانات لما يسميه مطورو الألعاب «الميزانية»: يتم تنفيذ العمل المكلف مرة واحدة، خارج المسار الحرج، ولا يقرأ طلب المستخدم سوى الإجابات المحسوبة مسبقًا.

7.2 The silent truncation that hid cat

In late August 2026 the English layer of the corpus was imported with a row cap that no one intended to be a cap at all. The supervising import script limited the English Open Multilingual Wordnet import to 50,000 candidates — and then reported success [H] (session log, 6 September 2026, root-cause entry). English cat is candidate number 52,195 in the file's alphabetical order. It was cut off. Roughly 21,830 of the 117,659 English synsets were never created; for those meanings, English senses existed as raw dictionary entries but were never linked to concepts. The word cat was not missing from the database — it was invisible to the map: a search for its meaning could not find it, because the meaning-node its senses should have pointed to had never been built [H] (same source).

لمدة ستة أيام تقريبًا، لم يكن أحد على علم بالأمر. النسخة التجريبية التي كان المؤلف يهتم بها — cat · gato · 猫 مع تقييم نجمة واحدة — كانت تعمل باللغتين الإسبانية واليابانية، لكنها لم تُظهر أي نتائج باللغة الإنجليزية، وبدت النتيجة الفارغة وكأنها فجوة في البيانات — كما لو أن اللغة الإنجليزية تفتقر إلى هذه الكلمة. (ملاحظة توقيتية من السجل: لم تظهر «السماء» متعددة اللغات إلا عندما انتهى integrate_core6.py من ربط اللغات المستوردة قرب نهاية دورة الاستيراد في أغسطس-سبتمبر — وقبل ذلك، كانت «السماء» الاحتياطية عبارة عن عرض صغير بلغة واحدة — ولهذا السبب لم يظهر الفراغ في اللغة الإنجليزية إلا في أوائل سبتمبر، بمجرد أن أصبح عرض المفاهيم المشتركة متاحًا فعليًّا [H] (سجل الجلسة، 6 سبتمبر 2026).) وكان إصرار المؤلف نفسه، المسجل في سجل الجلسة، هو أن هذا كان "not a data gap — infrastructure" [H] (سجل الجلسة، 6 سبتمبر 2026). وكان على حق. لم يكن الفشل في البيانات بل في نزاهة خط الأنابيب: فقد أبلغ استيراد مقطوع عن نجاحه، ولم يكن هناك أي شيء في النظام مصممًا لملاحظة أن «النجاح» مع حد أقصى يبلغ 50,000 صف يعني الفشل بالنسبة للمرشح رقم 52,195.

7.3 The fix: an uncapped, idempotent repair chain

تُعد عملية الإصلاح — التي تم تصميمها وإطلاقها في 6–7 سبتمبر 2026، وتأكد اكتمالها في 8 سبتمبر 2026 (انظر القسم 10.1) — نموذجًا لكيفية إصلاح مسار البيانات دون فقدان البيانات أو الثقة في [H] (البرامج النصية وسجل الجلسة، 6–7 سبتمبر 2026):

  1. Re-import the English WordNet without the cap — بشكل متماثل، لذا فإن

يمكن إعادة تشغيل العملية المتوقفة ببساطة دون تكرار الصفوف؛

  1. re-run the synset-to-synset relations للمجموعات الدلالية التي تم إنشاؤها حديثًا؛
  2. integrate: ترقية مجموعات المعاني الجديدة إلى مفاهيم، وربط المعاني المكونة لها

حقول concept_id، وإعادة التعبير عن العلاقات المفاهيمية؛

  1. refresh the materialized views، بحيث تعكس الخريطة الجزء الذي تم إصلاحه

مجموعة النصوص؛ و

  1. verify end-to-end مع برنامج نصي للتحقق يثبت، انطلاقًا من

قاعدة البيانات وعبر الإشارة المباشرة API، تصل تلك الإشارة الإنجليزية cat إلى مفهوم القطة المنزلية princeton-wordnet:02121620-n إلى جانب الأعضاء المتعددو اللغات — gato، chat، Katze، — وأن يحتوي المفهوم على عناصر تصنيفية أعلى منه. وقد صُمم فحص القبول بحيث يكون إعادة التشغيل في أي وقت، ثم الخروج مع إعلان «ناجح» أو «فاشل» بصوت عالٍ.

ونظرًا لأن كل خطوة صُممت لتكون متجانسة (الحصول أو الإنشاء، التخطي في حالة الوجود)، فإن تعطل الجهاز أثناء عملية الإصلاح لا يكلف سوى الوقت: حيث يمكن إعادة تشغيل السلسلة وستكمل المهمة. وهذه الخاصية نفسها تحمي قاعدة البيانات النشطة من الحالات غير المكتملة.

7.4 The lesson: fail-loud vs. fail-silent

تُعد حلقة cat مثالاً نموذجياً لمشكلة يخشاها كل مهندس بيانات: a pipeline that fails silently and reports success. الدرس المنهجي — وهو أن الحد الأقصى لعدد الصفوف ليس معيارًا للنجاح، وأن على المستوردين التحقق من اكتمال البيانات، وليس مجرد إتمام العملية — يستحق أن يُذكر كمبدأ عام لبنية البيانات المفتوحة، حيث تصل مجموعات البيانات دون أي ضمانات ويتم تجميع مسارات البيانات يدويًّا. تم إضفاء الطابع المؤسسي على استجابة Lingua Mundi بشكلين: البرنامج النصي للقبول الذي يمكن لأي سلسلة استيراد مستقبلية، والقاعدة الدائمة للاستوديو التي تنص على أن الادعاءات غير المتحقق منها تُصنف على أنها غير متحقق منها — في قاعدة البيانات (مع إبقاء المعاني اليتيمة مرئية، ومستويات الثقة على الروابط) وفي كل سجل مكتوب (اتفاقية [H]/[O]/[NV] لهذه الورقة، الملحق أ). النظام الذي يمكنه إظهار معانيه اليتيمة هو نظام يمكن اكتشاف ثغراته. أما النظام الذي يخفيها فهو نظام ستُكتشف ثغراته — في نهاية المطاف، على يد أسوأ شخص ممكن: مستخدم يبحث عن cat.

8 · The interface: a star map of meaning

البيانات بحد ذاتها ليست منتجًا. كان السؤال الذي شكّل واجهة Lingua Mundi بسيطًا: what should looking at a map of meaning feel like? كانت إجابة المؤلف، التي تطورت خلال الأسبوع الأول من سبتمبر 2026، هي أنه يجب أن يبدو الأمر وكأنك تنظر إلى السماء — وبالتحديد، مثل خريطة كوكب كنز خيالي: خريطة ورقية قابلة للتنقل في الكون حيث يمثل كل نجم فكرة واحدة، واللغات هي التلسكوبات التي تختارها لرؤيته من خلالها [H] (سجلات الجلسات، 1–7 سبتمبر 2026). يصف هذا القسم الواجهة التي نتجت عن ذلك: استعارتها التربوية، ولغتها البصرية، وأدواتها، والانضباط الهندسي الذي يتيح تشغيل كل ذلك على جهاز كمبيوتر محمول من طراز 2014.

8.1 From dictionary page to sky: naming the product

مرت الواجهة بثلاث هويات مختلفة خلال أسبوعين، وتُظهر الأسماء تطور المنتج [H] (سجلات الجلسات، 31 أغسطس – 6 سبتمبر 2026). بدأت كصفحة قاموس عادية ("/gui/"، أُطلق عليها اسم المرصد في 31 أغسطس)، ثم أصبحت Planetarium في 1 سبتمبر مع انتهاء استيراد البيانات وظهور تصور لحقل النجوم، وبعد أن نظر المؤلف إلى النتيجة وأعلن أن النجوم «هي مجرد هيكل، وليست المنتج» — تحول في ليلة 6 سبتمبر إلى مستكشف للرسم البياني الدلالي : نفس السماء، لكن the point أصبح الآن هو المعنى، مع عقد تمثل مفاهيم مُصنَّفة باللغات التي تقوم بتمكينها، وحواف ملونة حسب عائلة العلاقة، ووظيفة بحث تزيل الغموض عن المعاني. تم الاحتفاظ بعرض السماء القديم ولكن دون ربطه؛ وأصبح المستكشف الواجهة الافتراضية لـ Lingua Mundi [H] (سجل الجلسة، 6 سبتمبر 2026).

8.2 The pedagogical metaphor: an instrument, not a dashboard

يرتبط كل عنصر من عناصر الواجهة ارتباطًا مباشرًا بمفهوم من علم الفلك ومن مشروع اللغة نفسه — وهو تصميم تربوي متعمد (جدول الاستعارات هو الوثائق الداخلية للمنتج) [H] (سجلات الجلسات، 6–7 سبتمبر 2026):

Star-map elementWhat it really is
A starA concept — one meaning, shared across languages
The stars' brightness (magnitude)A concept's lexical richness and connectedness (Section 5.5)
The language you look throughA telescope — the same sky seen in Spanish, English, Japanese…
Constellations and threadsFamilies of relations — the is-a taxonomy drawn as plotted course lines
Zooming inDescending from the wide sky to a single star and its neighborhood (the Hipparcos→Gaia idea — Gaia Collaboration et al. (2018): more detail the deeper you go)
The exposure dialDeepening the field — asking for more and dimmer stars around a focus
The sextantMeasuring a route between two meanings through the taxonomy
SkymarksBookmarks on stars
The word compassThe enabled languages, ringing the focused star as word chips
The course logYour exploration trail — how you arrived at this meaning

ليس أي من هذا مجرد زينة؛ فقد وردت موجز متطلبات التصميم التي وضعها المؤلف لهذه الأداة في السجلات، وهي تستحق التكرار: يجب أن تكون الواجهة "أداة اكتشاف حقيقية، وليس لعبة" — خريطة لجميع اللغات التي يمكن للمتعلم أو الباحث استكشافها حقًّا — وينبغي أن تتصرف مصادرها كأنها خريطة ورقية قابلة للتنقل، وليس لوحة تحكم [H] (سجلات الجلسة، 6 سبتمبر 2026). وبنفس الروح، صُممت لوحات العدادات عمدًا skeuomorphic: أقراص تعريض بمقابض نحاسية، وقياسات السدس، ومسارات مخططة، وختم العصر — جماليات مرصد قديم، تم اختيارها للتعليم عن طريق الإحساس بدلاً من تسميات القوائم.

8.3 What is on screen

يوفر المستكشف [H]، الذي تم التحقق من صحته من البداية إلى النهاية في سبتمبر 2026، ما يلي:

  • Search with sense disambiguation. عند كتابة gato (الإسبانية) يتم إرجاع

النجوم الدلالية؛ يمكن أن تُظهر كل نتيجة الكلمات التي تشترك فيها اللغات المختلفة المعنى — تعرض لوحة نجم القط المنزلي أعضاء مجموعة المعاني متعددة اللغات، على سبيل المثال: الإنجليزية cat و grimalkin، والألمانية Katze، الياباني (القسم 8.5).

  • Travel. انقر على نجمة (أو انقر مع الضغط على مفتاح Shift / اضغط على مفتاح المقياس) لـ

يصبح هو محور الاهتمام؛ فتتجه الأنظار إليه من جديد، ويظهر ما يحيط به.

  • The star panel. عدد أعضاء «The Focused Star» حسب اللغة، و

التعريف، والأحياء المجاورة له — مع ترقيم الصفحات للأحياء الكبيرة.

  • The taxonomy lens. الصعود إلى والدي نجم ما ("ما هذا، هل هو نوع من...")

"من؟") أو ينحدر إلى فروعها ("ما هي أنواع هذا؟") على طول المسندات القياسية من عائلة is-a.

  • The instruments (جميعها نشطة ومُثبتة): يوسع exposure dial

مجال النجوم المركّز على مراحل (90 → 180 → 360 → 720 → 1,000 نجم)، الاندماج مع السماء الشاسعة دون الحاجة إلى السفر مجددًا؛ يبلغ قياس sextant مسار محدود في الرسم البياني بين نجمين (البحث /graph/path الوارد في القسم (5.3)، ورسم مسارًا ذهبيًّا متقطعًا عبر السماء وتسجيل كل مرحلة؛ نجوم skymarks (تم حفظها محليًّا، لذا يمكنك إنشاء كوكبة صغيرة خاصة بك (تظل قائمة بعد إعادة التحميل)؛ ويحيط word compass بالنجم المستهدف بكلمة الرقائق — رقاقة واحدة لكل لغة ممكّنة، يمكن النقر عليها لتغيير لغة البحث اللغة؛ و course log, home bearing, epoch stamp, and reticle لإبقائك على اطلاع [H] (سجل الجلسة، 7 سبتمبر 2026).

  • The support affordance. يفتح زر التحكم "✦ دعم" نافذة التبرع

الوضع (المادة 10).

8.4 Engineering the sky on 2014 hardware

جمال الواجهة يخضع لقيود صارمة واحدة: يجب أن تعمل بسلاسة على جهاز مزود بمعالج من طراز عام 2014، وذاكرة وصول عشوائي (RAM) سعة 8 جيجابايت، وقرص دوار — وهو نفس الجهاز الذي يستضيف قاعدة البيانات. إن الهندسة التي تجعل هذا الأمر ممكنًا تستحق التوثيق لأنها تنتمي إلى نفس مجال bounded work المذكور في القسم 7، مطبقة على وحدات البكسل [H] (سجلات التدقيق والجلسات، 6–7 سبتمبر 2026):

  • The page renders only on input.: معدل استخدام وحدة المعالجة المركزية (CPU) في وضع الخمول يبلغ حوالي 0٪؛ لا شيء

لا تتحرك إلا إذا قام المستخدم بعمل ما. ولا يوجد استمرار دائم الرسوم المتحركة — خيار متعمد في ظل «الميزانية الضئيلة» (القسم 9).

  • The nebula is baked. الخلفية الزخرفية (أرجواني/أزرق مخضر/وردي

(الزهور والغبار) يتم رسمها مرة واحدة عند كل عملية تغيير للحجم ثم يتم تخزينها في ذاكرة التخزين المؤقت، مع تباين الكاميرا عند إعادة الرسم، بدلاً من إعادة حسابه لكل إطار.

  • Labels are rationed. يتم رسم حوالي 24 علامة نجمية فقط في كل إطار — أ

ميزانية التسمية — الحفاظ على انخفاض تكلفة إعادة الرسم وضوح النص [H] (الـ تحدد الواجهة مواقع رموز الحدود باستخدام MAX_LABELS = 24؛ (gui/planetarium-v1.html).

  • Requests are protected.: رموز الاستجابة المتقادمة وعناصر التحكم في الإلغاء

إلغاء الاستفسارات أثناء التشغيل عندما ينتقل المستخدم إلى مكان آخر؛ والنقر المزدوج يؤدي إلى تأجيلها إجراءات بنقرة واحدة، بحيث لا يتم إهدار أي عمليات استدعاء؛ ويتم إزالة الارتداد عن عمليات تغيير الحجم و يتم تحديد الحد الأقصى لنسبة بكسلات اللوحة (مما يؤدي إلى تقليص حجم الذاكرة المخصصة لإعادة التحجيم من (من حوالي 24 ميغابايت إلى حوالي 11 ميغابايت بدقة 1080p).

  • Accessibility is explicit:: أدوار القماش وتسميات ARIA، حركة مخففة

تمت إضافة الدعم ومسافة ضغط المفاتيح في نفس المرحلة التي تمت فيها التعديلات المرئية البولندية [H] (سجل الجلسة، 7 سبتمبر 2026).

8.5 The demo that ties it together

العرض التوضيحي الجاري للمشروع هو الكلمة cat — أو بالأحرى المفهوم الذي تنتمي إليه. ابحث عن gato باللغة الإسبانية في المستكشف، وانتقل إلى النجم، وستعرض اللوحة مجموعة المرادفات princeton-wordnet:02121620-n مع أعضائها عبر اللغات الحية. أما المجموعة الفرعية التي تم التحقق منها فعليًّا من البداية إلى النهاية في عمليات الفحص الآلية التي أجريت في 6–7 سبتمبر 2026، فقد تم تسجيلها في سجل الاختبار — الإنجليزية cat, grimalkin وfelis silvestris catus (الاسم العلمي WordNet)، والألمانية Katze، والإسبانية gato، واليابانية — وقوائم الأعضاء الأوسع نطاقًا التي تخزنها قاعدة البيانات لتلك المجموعة الدلالية (على سبيل المثال: الإنجليزية housecat, mouser, puss, tomcat؛ الفرنسية chat, chatte؛ الألمانية Kater؛ اليابانية ネコ؛ البرتغالية gato, bichano) تأتي من عضوية WordNet المستوردة وليس من سجل «من البداية إلى النهاية»؛ ويمكن للقارئ الذي يرغب في الحصول على التعداد الكامل الحالي إعادة تشغيل استعلام القبول الوارد في القسم 7.3 [H with [NV] on the untested tail] (سجل E2E بدون رأس وقاعدة بيانات حية، 6–7 سبتمبر 2026). نجمة واحدة، ست لغات، معنى واحد: الحدس الخاص بشهر ديسمبر 2025 ، الظاهر على الشاشة. الجانب الإنجليزي من هذا العرض التوضيحي هو بالضبط ما تعطله مؤقتًا الخطأ المذكور في القسم 7.2: فقد وصل البحث gato المدفوع بالإسبانية إلى النجمة طوال الوقت، في حين أن البحث cat المدفوع بالإنجليزية لا يعمل إلا بعد إصلاح التغطية، ونص القبول الوارد في القسم 7.3 موجود بالضبط لإثبات، عند الطلب، أن cat · gato · 猫 يشتركان في نجمهما.

9 · The workbench: tools, workflow, and the "potato" machine

لا يكتمل تاريخ أي مشروع دون ذكر طاولة العمل التي بُني عليها. طاولة العمل الخاصة بـ Lingua Mundi غير عادية، وقد شكلت القيود التي فرضتها تقريبًا كل قرار هندسي ورد في هذه الورقة البحثية.

9.1 The potato

الجهاز الذي يستضيف قاعدة البيانات، و API، والواجهة، و بيئة التطوير هو جهاز كمبيوتر محمول عادي: جهاز ASUS X751MA مزود بمعالج Intel Pentium N3540 (Bay-Trail, four cores, no AVX2), وذاكرة وصول عشوائي (RAM) سعة 8 GB (7.6 جيجابايت قابلة للاستخدام)، و 5400 rpm hard disk، واتصال إنترنت بسرعة تبلغ تقريبًا 47 KB/s — تم تسجيل هذه البيانات مباشرةً من أجل هذه الورقة البحثية في 7 سبتمبر 2026 ([H]، lscpu//proc/meminfo على الجهاز نفسه). تصف ملاحظات المشروع هذا الجهاز نفسه بأسماء مختلفة مثل Atom Z36xx/Z37xx أو Pentium N3540 — وهي نفس عائلة رقائق Bay-Trail تحت أسماء مختلفة [O]؛ كما تشير سجلات الدردشة في أوائل عام 2026 إلى ملف تعريف مختلف (جهاز Intel Jasper Lake "N5105")، والذي يدرجه القسم 10.2 باعتباره تعارضًا غير محلول في سجلات الأجهزة. يطلق الاستوديو على الجهاز المباشر، بمودة، اسم the potato — وقد وضع قاعدة تظهر في جميع أنحاء السجلات: one heavy operation at a time، أغلفة محمية بالذاكرة، لا رسوم متحركة دائمة، لا بنية تحتية سابقة لأوانها (القسم 4.5)، وكل مهمة ثقيلة تُجرى كبرنامج نصي منفصل ذاتي التنبيه يُبلغ عند الانتهاء بدلاً من استدعائه [H] (سجلات الجلسات والأدوات، سبتمبر 2026). إن نمط «الخبز، لا إعادة الاشتقاق» (القسم 7)، والواجهة المخصصة للإدخال فقط (القسم 8.4)، وسطح البحث بدون تكلفة LLM (القسم 9.4) كلها، في جوهرها، نتائج لـ«البطاطس» — دليل على أن الميزانية المحدودة يمكن أن تكون ميزة في التصميم بدلاً من أن تكون قيدًا.

9.2 The software stack

نظام التشغيل (تم التحقق منه فعليًّا، سبتمبر 2026 [H]): PostgreSQL 16 كمخزن بيانات وحيد (القسم 4.5)، وFastAPI (بايثون) كطبقة API ، و SQLAlchemy + Alembic للنماذج وعمليات الترحيل، ونصوص Python لأدوات الاستيراد وإدارة العروض المادية، وواجهة ويب صغيرة خالية من التبعيات (HTML/CSS/JavaScript) يتم تقديمها من نفس المصدر. تشمل الآليات المساعدة خدمات المستخدم systemd التي تحافظ على استمرار عمل API وواقي الذاكرة/الحرارة (القسم 9.5)، ونسخة احتياطية يومية GitHub لقاعدة الكود، وقاعدة معارف Obsidian باعتبارها ذاكرة المشروع (القسم 9.3)، وفحوصات شاملة من البداية إلى النهاية لـ Chromium بدون واجهة للمستخدم، و أدوات detach-run + notify الخاصة بالاستوديو للمهام الخلفية ذاتية التنبيه [H] (قائمة الخدمات والأدوات، سبتمبر 2026).

9.3 The knowledge base: a project memory that can be audited

ابتداءً من 26 أغسطس 2026، احتفظ المؤلف ووكلاؤه بقاعدة معرفية منظمة (خزينة «أوبسيديان») تُسجَّل فيها كل جلسة عمل: العمل المنجز، والقرارات المتخذة، والإجراءات التالية، والملف الذي استُمدت منه كل حقيقة، مع تسجيل مصدر المعلومات في مقدمة الملف وعلامة verified: true/false [H] (قواعد الخزينة، أغسطس–سبتمبر 2026). يُعد هذا «الخزنة» السبب وراء قدرة هذه الورقة على الاستشهاد بالتواريخ والاقتباسات أصلاً: فعندما تشير هذه المسودة إلى «سجل الجلسة، 6 سبتمبر 2026»، فإنها تشير إلى ملف موجود، كُتب في ذلك اليوم، ويحتوي على ملاحظات المصدر الخاصة به. هناك قاعدتان من قواعد ذلك المستودع تستحقان الذكر باعتبارهما method: يُفترض أن يذكر كل ادعاء مصدره، ولا يتم اختلاق التاريخ أبدًا — يتم الاحتفاظ بالمواد غير المؤكدة ولكن يتم تمييزها بعلامة «غير متحقق منها» [H] (قواعد المستودع). وتلك القواعد هي قواعد هذه الورقة (الملحق أ).

9.4 Zero-token research and the local-first rule

القاعدة الثابتة التي يتبعها المؤلف — والتي تظهر في مذكرة المشروع المؤرخة في 29 أغسطس 2026 — هي أن المحلي API is سطح البحث: /lexemes، /concepts، /analyze تجيب على الأسئلة المتعلقة بالمجموعة النصية التي استغرق zero LLM tokens [H] إنفاقها. ويحكم نفس المبدأ الذي يضع الأولوية للبيانات المحلية (كل شيء مستضاف ذاتيًا؛ ولا يعتمد أي شيء على مورد)، والمال (مستويات مجانية وبيانات مفتوحة فقط؛ القسم 10)، والخصوصية (الأسرار لا تغادر الجهاز أبدًا؛ قاعدة المعرفة خاصة) [H] (سجلات الجلسات، سبتمبر 2026).

9.5 Guardrails on a fragile machine

ونظرًا لعدم توفر مساحة إضافية في استوديو «البطاطا»، فقد تم تركيب حواجز أمان تُعد بحد ذاتها جزءًا من القصة الهندسية: جهاز memory/thermal guard (tools/mem-manager.sh، الإصدار 2، تم تشغيله في 7 سبتمبر 2026) الذي يصدر تحذيرًا عند انخفاض الذاكرة المتاحة إلى ما دون 900 MiB أو 80 °C ويقوم بإلغاء وحدات الخلفية الاختيارية عند انخفاضها إلى ما دون 500 MiB أو 88 °C، بالإضافة إلى قاتل OOM المبكر على مستوى النظام ** (earlyoom -m 8 -s 5، أي أنه يعمل عندما تنخفض الذاكرة الحرة إلى ما دون 8%، بوتيرة كل 5 ثوانٍ) [H] (التكوين الفعلي: عتبات mem-manager.sh و /etc/default/earlyoom، اقرأ 7 سبتمبر 2026). تحافظ قواعد تشغيل الاستوديو على عدم الحاجة إلى تفعيل تلك الحواجز أبدًا: one heavy operation at a time، وأغلفة محمية بالذاكرة، ومهام منفصلة ذاتية التنبيه لكل ما يستغرق وقتًا طويلاً. تُكتب عمليات الإصلاح الطويلة لتكون idempotent** (الحصول أو الإنشاء، التخطي في حالة الوجود) بحيث لا يؤدي أي انقطاع — إعادة تشغيل، انقطاع التيار الكهربائي، رحلة الحراسة — لا تكلف سوى الوقت: يمكن ببساطة إعادة تشغيل عملية الإصلاح وستقوم بإنهاء المهمة (القسم 7.3). ويعامل هذا النهج التزامن نفسه كمورد يجب تخصيص ميزانية له، مثل الذاكرة أو القرص.

9.6 Governance: licenses, attribution, and the "free forever" decision

يتم إدخال كل مجموعة بيانات في Lingua Mundi مع تسجيل ترخيصها (في قائمة جرد المستودع docs/DATA_LICENSES.md؛ وجدول قاعدة البيانات النشطة source ) [H]: WordNet (ترخيص متساهل)، و Open Multilingual Wordnet (تراخيص لكل لغة، معظمها CC BY-SA و CC BY)، Wiktionary و kaikki (CC BY-SA، مع شروط GFDL القديمة)، Wikidata (CC0)، UniMorph (CC BY-SA 3.0)، Universal Dependencies (CC BY-SA 4.0)، JMdict/KANJIDIC2 و عائلة EDRDG (تراخيص متساهلة، مع ذكر المصدر)، OPUS (حسب مجموعة البيانات)، CLICS وقوائم تكرار الكلمات (حسب المصدر)، وما إلى ذلك [H] (قائمة التراخيص، تم الوصول إليها في سبتمبر 2026). ويبادل المشروع هذا التفضيل: فمن المخطط أن تكون مخرجاته حرة أيضًا.

تطورت funding model علنًا على مدار تسعة أيام في أواخر أغسطس/أوائل سبتمبر 2026، ويُظهر السجل كل خطوة في [H] (سجلات الجلسات والتقويم، 29 أغسطس – 7 سبتمبر 2026): خطة أولية لبيع تطبيق قاموس Core-6 غير متصل بالإنترنت (Texupan، 29 دولارًا أو 9 دولارات شهريًّا) في 29 أغسطس؛ وإدراج التطبيق في المتجر مع روابط الدفع على store hub بحلول 1 سبتمبر؛ و— بحلول 7 سبتمبر — قرار بتحويل Lingua Mundi إلى free forever، بتمويل من التبرعات الطوعية، مع تسمية منتج Stripe حرفيًا "Lingua Mundi — ابقِه مجانيًا إلى الأبد"، بأسعار لمرة واحدة تبلغ 5 يورو/15 يورو/50 يورو، وأسعار شهرية تبلغ 3 يورو/9 يورو/25 يورو، و هدف سنوي صادق لـ €2,400 لتغطية تكاليف البنية التحتية وأعمال بيانات اللغة التالية [H] (سجل الجلسة، 7 سبتمبر 2026). تم إنشاء الحساب عمدًا dormant — مع تعطيل التبرعات حتى يكمل المؤلف التحقق من الهوية لدى مزود الدفع — بحيث يكون "مجاني إلى الأبد"، حسب صياغة المؤلف، verifiable claim، وليس مجرد شعار [H] (سجل الجلسة، 7 سبتمبر 2026). اكتمل التحقق من الهوية في 8 سبتمبر 2026 وتم تفعيل روابط الدفع الستة في صباح ذلك اليوم؛ وقد نُشرت في قسم التمويل بالمتجر [H] (سجل الحساب Stripe وسجل روابط الدفع، 8 سبتمبر 2026). يتبع النص الموجه للجمهور قاعدة «صوت الاستوديو» (المقدمة) وقاعدة «النص الصادق»: لا مبالغة، ولا ادعاءات مبالغ فيها — وهي نفس المعايير التي تحكم قاعدة البيانات وهذه الورقة البحثية.

10 · Where the project stands (7 September 2026), its honest limits, and its road ahead

10.1 Current state of the system

تم إجراء القياس مباشرةً على النظام الفعلي في 6–7 سبتمبر 2026 [H] (انظر الملحق أ للاطلاع على الاستعلامات الدقيقة):

  • Corpus (pre-repair snapshot, 6–7 September 2026): 96,434 مفهومًا · 1,238,383 وحدة لغوية · 1,608,018 معنى · 171,672 علاقة، في ست لغات حية (الإنجليزية، الإسبانية، الفرنسية، الألمانية، البرتغالية، اليابانية) — وقد تم تسجيل أرقام SQL بشكل متطابق في كلا تاريخي القياس.
  • Corpus (post-repair, 8 September 2026): 125980 مفهومًا / 125980 مجموعة مترادفات / 352333 وحدة لغوية إنجليزية، كما هو مسجل في تقرير الإصلاح (lm-en-coverage-REPORT-2026-09-08.txt، RESULT: PASS)؛ تشمل العناصر متعددة اللغات في مجموعة cat star princeton-wordnet:02121620-n اللغات الإنجليزية والإسبانية واليابانية والألمانية والبرتغالية (cat، gato، 猫، Katze، Gato doméstico).
  • Ranking views: concept_sky_rank 94,498 صفًا؛ concept_lang_rank

218,120 صفًا؛ concept_word_rank 338,378 صفًا عند الإنشاء (إعادة عد حية) تم رفض منح هذا الدور لقاعدة البيانات القياسية؛ تم وضع علامة [NV] عليه).

  • السماء الافتراضية لـ Performance: ≈ 0.25 ثانية دافئة (8.6 ثانية قبل الترتيب)

عدد المشاهدات)؛ استعلام عميق يضم 1,000 نجم مع الكلمات ≈ 1.1 ثانية (>60 ثانية قبل الكلمات العرض)؛ عمليات البحث عن مسار الرسم البياني بالميلي ثانية؛ البحث ≈ 0.5 ثانية (بعد التسخين) / ≈ 10 ثوانٍ انخفاض درجة حرارة ذاكرة التخزين المؤقت للصفحات في القرص الصلب.

  • مستكشف الرسم البياني الدلالي Interface: متاح الآن على الموقع الأصلي لـ API، مع

جميع الأدوات (قرص تحديد الاتجاه، السكستانت، علامات السماء، البوصلة اللفظية، المسار (السجل، طابع الحقبة) تم التحقق منها من خلال 23/23 عملية فحص شاملة باستخدام متصفح بدون واجهة على 6–7 سبتمبر 2026.

  • English coverage repair:: سلسلة التحقق من طرف إلى طرف للبيانات الإنجليزية WordNet غير المحدودة، والتي تشمل إعادة الاستيراد والعلاقات والتكامل وتحديث العرض (القسم 7.3) تم إطلاقها صباح يوم 7 سبتمبر 2026 واستمرت حتى اكتمالها في 8 سبتمبر 2026 الساعة 22:19 (2026-09-08 22:19:12). اجتازت بوابة القبول: يسجل التقرير الخاص بالسلسلة (lm-en-coverage-REPORT-2026-09-08.txt، RESULT: PASS) المعنى المرتبط بالمفهوم باللغة الإنجليزية cat على princeton-wordnet:02121620-n، الذي يشمل أعضاؤه متعددي اللغات كلمات مثل cat، gato، 猫، Katze، Gato doméstico [H] (التقرير، 8 سبتمبر 2026).
  • قناة التبرعات Governance: أصبحت نشطة — اكتمل التحقق من الهوية في 8 سبتمبر 2026، ونُشرت ستة روابط للدفع في المتجر؛

التحقق من مزود خدمات الدفع الخاص بالمؤلف؛ وإجراء نسخ احتياطي لقاعدة الكود يوميًا؛ قاعدة المعرفة محدثة.

10.2 What is honestly not known, and what is unresolved

تقتضي قواعد التحقق المتبعة في الاستوديو أن تذكر هذه الورقة بوضوح ما لم تتمكن من التحقق منه، وأن تسجل التناقضات بين المصادر. وفيما يلي أهمها:

  1. The "Core 6" discrepancy. مجموعة اللغات الشخصية للمؤلف (مسجلة

(29 أغسطس 2026) هي الإسبانية، والإنجليزية، واليابانية، والفرنسية، وItalian، و البرتغالية. اللغات الست التي تتضمنها قاعدة البيانات الحية هي الإنجليزية والإسبانية، الفرنسية، وGerman، والبرتغالية، واليابانية. وقد حلت الألمانية محل الإيطالية في قاعدة البيانات التي لا يوجد بشأنها أي تفسير مكتوب باقٍ؛ اللغة الإيطالية تم تسجيل مجموعات البيانات الخاصة بـ «رو» و«الإيطالية» في وقت سابق، لكن الجدول المباشر يحتوي على الرمز الألماني [H] والسبب [NV] (انظر أيضًا القسم 4.2 بشأن مستويات المواصفات، التي شملت اللغتين الماندرين والإيطالية دون الألمانية — (ثلاث مجموعات لغوية مختلفة تم نشرها في غضون ثلاثة أشهر).

  1. Corpus-count drift within a single day. ملف تقني تم إعداده في

تشير بيانات 6 سبتمبر 2026 إلى وجود 1,146,066 وحدة لغوية / 1,595,537 معنى، في حين أن أفادت قناة SQL المباشرة في نفس المساء عن أرقام 1,238,383 / 1,608,018 (المفاهيم و القيم متطابقة: 96,434 / 171,672)؛ سجل الجلسة الخاص بنفس ويحتوي المساء على مجموعة ثالثة متوسطة الحجم (≈1.15 مليون وحدة لغوية)، بما يتوافق مع الواردات التي لا تزال تصل على مدار اليوم. المجاميع حسب اللغة تتوافق مع الرقم SQL، لذا يبدو أن الأرقام الواردة في الملف مستمدة من لحظة أو مرشح مختلف؛ ولا يوجد تفسير لهذا التباين في السجل [H] مع التسوية [O]. تستشهد هذه الورقة بـ أرقام SQL مع تواريخها.

  1. Hardware records conflict. الجهاز الذي يستضيف النظام التشغيلي في

تم التقاط صورة جهاز ASUS X751MA مباشرةً في إطار إعداد هذه الورقة البحثية مع معالج Intel Pentium N3540 (Bay-Trail)، وذاكرة وصول عشوائي (RAM) سعة 8 جيجابايت (القسم 9.1) [H]. أما السجل المكتوب فهو أكثر فوضى: فملاحظات المشروع تصف الصندوق مثل معالج Intel Atom Bay-Trail (Z36xx/Z37xx) ومثل معالج Pentium N3540 — الـ نفس الجيل من السيليكون تحت اسمين تجاريين هما [O] — بينما في السابق تشير سجلات المحادثات لعام 2026 إلى جهاز آخر، وهو جهاز من إنتل Jasper Lake "N5105" مزود بذاكرة وصول عشوائي (RAM) سعة 12 جيجابايت (يناير 2026) والإصدارات الأحدث على النحو التالي: "رقاقة جاسبر ليك ذات 4 نوى" (مايو 2026) و"إنتل جاسبر ليك N5105، 4 جيجابايت" (ملف ذاكرة من منتصف عام 2026). معالج «جاسبر ليك» ليس من نوع «باي-تريل» السليكوني، لذا فإن تصف السجلات إما جهازين مختلفين على مدار العام أو خطأ في تصنيف المساعد؛ ولا يمكن للأدلة المتبقية تحديد أيهما هو الصحيح، و تم تسليط الضوء على هذه النقطة هنا بدلاً من التغاضي عنها [H] مع التسوية [NV] (سجلات الجلسات وسجلات المحادثات التي أجراها الذكاء الاصطناعي، (يناير – سبتمبر 2026).

  1. Data-quality warnings from the September audit:: يحتوي المجموع على

178,576 زوجًا من المصطلحات المكررة؛ 124,790 وحدة لغوية بدون معنى؛ 33.9% من التعريفات فارغة؛ و(قبل عملية التصحيح باللغة الإنجليزية) 71.7% من المعاني لم تُدرج بعد مرتبطة بالمفاهيم. وقد أظهر نفس التدقيق أن التكامل المرجعي قد تم الحفاظ عليه في جميع الأجزاء (المجاميع دقيقة، ولا توجد أي صفوف معلقة أو يتيمة على مستوى قاعدة البيانات): يشير الرقم 71.7% إلى الحواس not yet linked to a concept، و صُممت لتظهر حالة «اليتيم المرئي»، وليس الروابط المعطلة — تصميم صادق التمييز الذي يحرص المشروع على إبقائه ظاهرًا أثناء أعمال المواءمة يتابع [H] (التدقيق، 5-6 سبتمبر 2026).

  1. أداء Unmeasured or pending: على أجهزة أخرى غير «البطاطا»

لم يتم قياسه قط؛ ولا يوجد للمشروع أي مستخدمين عامين حتى الآن، لذا فهناك لا توجد مقاييس للاستخدام الفعلي؛ والهيكل القانوني للاستوديو غير موثق في السجلات؛ مسألة نمذجة «كوريا الشمالية وكوريا الجنوبية»، ندرة البيانات باللغة الكانتونية، كما أن عملية مراجعة ترخيص «ووردنت» التايواني مفتوحة (القسم 10.3).

10.3 The road ahead

تعد خارطة الطريق، التي وافق عليها المستخدمون في 29 أغسطس 2026، النسخة النهائية للرسوم البيانية السبعة [H] الواردة في المخطوطة الصادرة في يونيو (مذكرة المشروع): علم الأصوات/علم الصوتيات، علم الصرف (مستورد)، علم النحو (مستورد)، علم الدلالة (مستورد)، علم المعجم (مستوردة)، والمجموعات النصية (مستوردة)، و— قيد الانتظار — الخطاب، وعلم أصل الكلمات، و طبقات التوافق والاستخدام، بالإضافة إلى واجهة الويب العامة في نهاية المطاف. وفي المدى القريب، تتمثل الخطط الموثقة في [H] (سجلات الجلسات، 7 سبتمبر 2026):

  • The CJKV family. اللغات التالية المقرر إدراجها في المخطط هي

الماندرين (cmn)، والكانتونية (yue)، والكورية (kor)، والفيتنامية (vie). ولغاتهم يعتمد الجدول الزمني على استطلاع صادق بشأن مدى توفر البيانات حول ما يقدمه مجال البيانات المفتوحة: توجد شبكات الكلمات OMW Wiktionary لللغة الماندرين (19,079 صفًّا)، والكانتونية (527)، والكورية (9,268)، و الفيتنامية (5,498)؛ قواعد البيانات اللغوية لـ UD للغة الماندرين (123 ألف وحدة لغوية)، والكانتونية (14 ألف)، الكورية (80 ألف GSD بالإضافة إلى 350 ألف KAIST)، الفيتنامية (58 ألف). أما الكانتونية فهي النادرة — لا توجد شبكة كلمات كبيرة، وقاعدة بيانات شجرية صغيرة — والتايوانية تخضع تراخيص WordNet للمراجعة [H] (سجل الجلسة والبيانات) قائمة الجرد، 7 سبتمبر 2026). لم يتم استيراد أي مجموعة بيانات CJKV إلى مجموعة النصوص الحية حتى تاريخ إعداد هذه المسودة؛ أما توقيت العائلة فهو قرار لم يُحسم بعد ريثما يتم إجراء تلك المراجعة.

  • Research-v1 interface panes (عدسة الكلمات، تسلق السلالة، بطاقات الحقل،

(دفتر الملاحظات، جدول المقارنة) تم تصميمها واعتمادها من قِبل فريق العمليات الخلفية في 6 سبتمبر 2026، وتم إدراجه في قائمة الانتظار خلف جهاز [H] قيد التصنيع.

  • Publication. هذه الورقة هي مسودة أولية تم إنشاؤها بواسطة الذكاء الاصطناعي؛ و

يجري حالياً إعداد منشور من تأليف بشري (الأجزاء التمهيدية).

  • Languages without end. الوعد الذي يحمله المخطط — إضافة لغة واحدة

مجموعات البيانات «Row Plus» — هي الهدف طويل الأمد المعلن للمشروع، و توضح حملة التبرع ذلك بوضوح: Lingua Mundi تبدأ بست لغات، صُمم لإضافتها إلى ما لا نهاية [H] (سجل الجلسة، 7 سبتمبر 2026).

10.4 Conclusion

ما بدأ في 3 ديسمبر 2025 كطلب للحصول على ملفات قواميس مجانية أصبح الآن خريطة معاني قابلة للتشغيل والبحث تضم ست لغات، مبنية على البيانات المفتوحة من قبل شخص واحد باستخدام أدوات مجانية وجهاز كمبيوتر محمول من طراز عام 2014. الأفكار التي حملت هذا المشروع — أن المعنى هو الوحدة الطبيعية للبيانات متعددة اللغات؛ وأن المواءمة يجب أن تكون صريحة ومُصنَّفة، ولا تُخمَّن أبدًا بصمت؛ وأن الحسابات المكلفة يجب أن تُجرى مرة واحدة وتُستخدم مرات عديدة؛ وأن قيود الميزانية هي أداة تصميم؛ وأن كل ادعاء، سواء في قاعدة بيانات أو في ورقة بحثية، يجب أن يحمل مصدره وتاريخه — ليست جديدة، لكنها true، ويثبت المشروع أن شخصًا واحدًا يمكنه العمل بها. وربما لا تكون أهم إنجازاته هي قاعدة البيانات على الإطلاق، بل إثبات أن باحثًا منفردًا يمكنه بناء بنية تحتية نزيهة على الملأ: قياس ما يقيسه، وتأريخ ما يؤرخه، وإظهار «أيتامه»، والوفاء بوعده — نجمة واحدة، ست لغات، والسماء بأكملها لا تزال أمامه.

Built in a cave, with a bunch of scraps.

References

الطبعة السابعة من دليل APA. تم التحقق من التفاصيل الببليوغرافية بمقارنتها بصفحات الناشر وسجلات معرّف الكائن الرقمي (DOI) في 7 سبتمبر 2026. وقد تم الاستشهاد بالبرامج ومصادر البيانات وفقًا لصيغ APA الخاصة بالبرامج ومجموعات البيانات. (لم تُدرج سوى الأعمال المذكورة في النص.)

بوند، ف.، وفوستر، ر. (2013). ربط وتوسيع شبكة كلمات مفتوحة متعددة اللغات . في وقائع الاجتماع السنوي الحادي والخمسين لجمعية اللغويات الحاسوبية (ص 1352–1362). جمعية اللغويات الحاسوبية . https://aclanthology.org/P13-1133/

معهد برايل الأمريكي. (2019). Atkinson Hyperlegible [خط حاسوبي]. https://brailleinstitute.org/freefont

برين، ج. و. (2004). JMdict: قاموس ياباني متعدد اللغات. في وقائع ورشة العمل حول الموارد اللغوية متعددة اللغات (COLING 2004) (ص 65–72). COLING. https://aclanthology.org/W04-2209/

مجموعة البحث والتطوير الخاصة بالقواميس الإلكترونية. (بدون تاريخ). JMdict / مشروع قاموس EDICT الياباني-الإنجليزي [ملفات البيانات والوثائق]. تم استرجاعه في 7 سبتمبر 2026 من https://www.edrdg.org/jmdict/edict_doc.html

فيلباوم، سي. (محرر). (1998). WordNet: An electronic lexical database. مطبعة معهد ماساتشوستس للتكنولوجيا . https://mitpress.mit.edu/9780262561167/wordnet/

مشروع «غايا»، براون، أ. ج. أ.، فاليناري، أ.، بروستي، ت.، دي بروين، ج. هـ. ج.، بابوسياو، س.، … زويتر، ت. (2018). الإصدار الثاني لبيانات غايا: ملخص للمحتويات وخصائص المسح. Astronomy & Astrophysics, 616، المقال A1. https://doi.org/10.1051/0004-6361/201833051

هيرنانديز، ر. (1 يونيو 2026). Lingua Mundi: بنية تحتية دلالية لنماذج اللغة القائمة على المفاهيم (الإصدارات 1–7) [مخطوطة غير منشورة؛ سجلات المراجعة والتدقيق محفوظة في أرشيف سجلات المحادثات الخاص بالمؤلف].

هيرنانديز، ر. (24 يوليو 2026). المنصة المعجمية متعددة اللغات — المواصفات الهندسية (الإصدار 2.0) [وثيقة مواصفات غير منشورة؛ نص مستخرج محفوظ في الملف].

كيروف، سي.؛ كوتيريل، ر.؛ سيلاك-غلاسمان، ج.؛ فالتر، ج.؛ فيلوموفا، إي.؛ شيا، ب.؛ فاروقي، م.، ميلكي، س. ج.، مكارثي، أ.، كوبلر، س.، ياروفسكي، د.، إيسنر، ج.، وهولدن، م. (2018). UniMorph 2.0: علم الصرف الشامل. في وقائع المؤتمر الدولي الحادي عشر حول موارد اللغة وتقييمها (LREC 2018). الرابطة الأوروبية لموارد اللغة. https://aclanthology.org/L18-1293/

مكارثي، أ. د.، كيروف، ك.، جريلا، م.، نيدهي، أ.، شيا، ب.، جورمان، ك.، فيلوموفا، إ.، ميلكي، س. ج.، نيكولاي، ج.، سيلففيربرغ، م.، أرخانجيلسكي، ت.، كريزانوفسكي، ن.، كريزانوفسكي، أ.، كلياتشكو، إ.، سوروكين، أ.، مانسفيلد، ج.، إرنشتريتس، ف.، بينتر، ي.، جاكوبس، س. ل.، … ياروفسكي، د. (2020). UniMorph 3.0: علم الصرف الشامل. في وقائع المؤتمر الدولي الثاني عشر لموارد اللغة وتقييمها (LREC 2020) (ص 3922–3931). الرابطة الأوروبية لموارد اللغة. https://aclanthology.org/2020.lrec-1.483/

ماير، سي. إم.، وغوريفيتش، إي. (2012). Wiktionary: منافس جديد للمسارد التي يضعها الخبراء؟ استكشاف إمكانيات علم المعجم التعاوني. في: س. غرانجر وم. باكوت (محرران)، Electronic lexicography (ص 259–292). مطبعة جامعة أكسفورد. https://doi.org/10.1093/acprof:oso/9780199654864.003.0013

ميلر، ج. أ. (1995). WordNet: قاعدة بيانات معجمية للغة الإنجليزية. Communications of the ACM, 38(11)، 39–41. https://doi.org/10.1145/219717.219748

نيفري، ج.، دي مارنيف، م.-ك.، جينتر، ف.، هاجيتش، ج.، مانينغ، س. د.، بيسالو، س.، شوستر، س.، تايرز، ف.، وزيمان، د. (2020). التبعيات العامة الإصدار 2: مجموعة بنوك الأشجار اللغوية متعددة اللغات المتنامية باستمرار. في وقائع المؤتمر الدولي الثاني عشر حول موارد اللغة وتقييمها (LREC 2020) (ص 4034–4043). الرابطة الأوروبية لموارد اللغة . https://aclanthology.org/2020.lrec-1.497/

جامعة برينستون. (بدون تاريخ). About WordNet. WordNet. تم الاطلاع عليه في 7 سبتمبر 2026، من https://wordnet.princeton.edu/

SIL International. (بدون تاريخ). ISO 639-3. تم الاطلاع عليه في 7 سبتمبر 2026، من https://iso639-3.sil.org/

دي سوسير، ف. (1983). Course in general linguistics (تحت إشراف ك. بالي، أ. سيشيهاي، وأ. ريدلينجر؛ ترجمة ر. هاريس). داكورث. https://www.bloomsbury.com/us/course-in-general-linguistics-9781472508829/ (نُشر العمل الأصلي عام 1916)

سبير، ر. (2022). wordfreq: قاعدة بيانات لتكرار الكلمات في العديد من اللغات (الإصدار 3.0) [برنامج حاسوبي]. GitHub. https://github.com/rspeer/wordfreq

تيدمان، ج. (2012). البيانات المتوازية والأدوات والواجهات في OPUS. في وقائع المؤتمر الدولي الثامن حول موارد اللغة وتقييمها (LREC 2012) (ص 2214–2218). الرابطة الأوروبية لموارد اللغة . https://aclanthology.org/L12-1246/

فранديتشيتش، د.، وكروتزش، م. (2014). Wikidata: قاعدة معارف تعاونية مجانية. Communications of the ACM, 57(10)، 78–85. https://doi.org/10.1145/2629489

مؤسسة ويكيميديا. (بدون تاريخ). Wiktionary: The free dictionary. تم الاطلاع عليه في 7 سبتمبر 2026، من https://www.wiktionary.org/

Zipf، ج. ك. (1949). Human behavior and the principle of least effort. دار أديسون-ويسلي للنشر. https://archive.org/details/humanbehaviorpri0000zipf

Appendix A · Sources, method, and verification

A.1 The annotation convention

وفقًا لمعايير الدقة التي يتبعها الاستوديو (المستمدة من عمله التحقيقي)، يتم تمييز الادعاءات الواردة في هذه الورقة في الحالات التي يحتاج فيها القارئ إلى معرفة حالتها المعرفية: [H] = حقيقة تم التحقق منها — قياس، أو رمز، أو مصدر مؤرخ تم الرجوع إليه في إعداد هذه الورقة؛ [O] = تفسير أو رأي منسوب؛ [NV] = غير مُثبت / لم يتم العثور عليه. كل رقم وارد في الملخص ونص المقالة هو إما قياس [H] مع تاريخه أو مُصنف بعلامة.

A.2 Source families consulted (access 6–7 September 2026)

#SourceWhat it provided
1Live codebase: …/SafeMode/Software Development/LinguaMundi/lingua-mundi (api/, core/, schemas/, importers/, scripts/, docs/, gui/)Architecture, schema, importers, materialized-view SQL, API routes, GUI code
2Live database lingua_mundi (PostgreSQL, 127.0.0.1:5433), direct SQLCorpus counts, language table, synset membership, concept links
3Live API (127.0.0.1:8765): /languages, /graph/sky, /graph/star, /graph/word, /graph/path, /openapi.jsonEndpoint behavior, warm/cold latencies, gzip
4Web interface (127.0.0.1:8765/gui) + headless-browser checksUI behavior; 23/23 end-to-end checks recorded 6–7 Sep 2026
5Vault knowledge base (session logs 26 Aug–7 Sep 2026, handoffs, project notes, conventions)Milestones, decisions, quotes, conventions, dates
6ChatGPT conversation archive (export 5 Sep 2026; 421 conversations with content)Origin and growth conversations, verbatim quotes (Section 1, 3, 4)
7DeepSeek data export (6 Sep 2026; 215 conversations)June 2026 manuscript revision cycle, setup logs
8Claude.ai data export (extracted 6 Sep 2026; legacy-memory file updated 7 Sep 2026)Long-horizon context, project roles
9Personal artifacts in the author's home directory (file timestamps, scripts, specification PDF, journals)Pre-project chronology (Nov–Dec 2025), engineering specification, journals
10Published scholarly and data sources (see References)Background and related work

استعلامات التحقق التمثيلية (تم تشغيلها في 7 سبتمبر 2026، الدور lingua): SELECT count(*) FROM concept|lexeme|sense|relation → 96,434 / 1,238,383 / 1,608,018 / 171,672؛ SELECT code FROM language → الألمانية، الإنجليزية، الفرنسية، اليابانية، البرتغالية، الإسبانية؛ عضوية مجموعة المرادفات 02121620-n لكل لغة (القسم 8.5)؛ نص القبول الخاص بالمشروع verify-lm-cat-demo.sh (القسم 7).

A.3 Key numbers with dates (compressed timeline)

DateEvent / figure
2025-11-11KANJIDIC2 downloaded (first dataset, file timestamp)
2025-12-03Origin message: "unified multilingual database" (ChatGPT log)
2025-12-05OMW data downloaded; first extract scripts
2025-12-08…16Merge/unified pipeline; four-entity (concept/sense/lexeme/grapheme) JSONL schema
2026-05-01OMW v2.0 coverage study
2026-05-23"Multilingual Lexical Platform" spec master (markdown)
2026-06-01Lingua Mundi named; manuscript V1–V7 revision cycle (DeepSeek + ChatGPT audits)
2026-07-17/18Code scaffolding; feasibility conversation; journal
2026-07-24Engineering Specification V2 (104 pp., PDF)
2026-08-13Lean-stack decision; semantic interaction layer
2026-08-19…25Japanese demo builds; 23 Aug concept descriptions
2026-08-27Daily GitHub backups begin
2026-08-29"LinguaMundi IS the lexicon" decision; roadmap approved; Core 6; Postgres live; UD importer
2026-08-30API routes (CORS, /lookup, /kanji); 27 tests green; first /gui deploy
2026-08-31Import restart (~1.13M rows); English OMW cap seeded the cat bug
2026-09-01Planetarium naming; ≈1.54M rows; store live
2026-09-05Deep audit; pagination fixes; 1,238,383 lexemes
2026-09-06Enrichment audit; materialized-view overhaul (94,498 / 218,120); words bake (338,378); GUI pivot to semantic-graph explorer; cat root cause; research-v1 approval
2026-09-07Instruments live (23/23 E2E); donation setup (dormant); English coverage repair chain launched; CJKV data-availability reconnaissance; this paper drafted
2026-09-08English coverage repair verified complete (8 September 2026 at 22:19); acceptance gate PASS recorded in lm-en-coverage-REPORT-2026-09-08.txt

A.4 Contradictions and unresolved items

كما هو موثق في القسم 10.2: التباين بين النسختين الإيطالية والألمانية من Core-6؛ و الانحراف في عدد وحدات النص في اليوم نفسه (ملف 1,146,066 مقابل SQL 1,238,383 وحدة لغوية، مع وجود رقم ثالث وسيط في سجل جلسة المساء نفسه، تمت مطابقته لكل لغة مع رقم SQL)؛ تعارض سجلات الأجهزة (Atom Bay-Trail مقابل Pentium N3540 مقابل Jasper Lake N5105 في سجلات أوائل عام 2026 — القسم 10.2 البند 3)؛ و71.7% من المعاني غير المرتبطة و تحذيرات أخرى بشأن جودة البيانات؛ والبنود غير المؤكدة/غير الموثقة: تاريخ تأسيس المستودع الدقيق قبل 26 أغسطس، وسبب تغيير مجموعة اللغات، ومصدر نموذج نصوص التدقيق بتاريخ 1 يونيو (توجد عمليات التدقيق في محادثة ChatGPT الخاصة بالمؤلف من جانب المستخدم؛ ولم يُذكر أي نموذج مساعد كتب أي جولة تدقيق لم يتم إثباتها بشكل مستقل في التصدير — انظر القسم 3.3)، وإعادة الفرز المباشر لـ concept_word_rank (تم رفض الإذن)، والهيكل القانوني للاستوديو.

A.5 Methodology notes

  • النظام قيد الاختبار is هو نظام الإنتاج؛ ويجري إجراء قياسات التسخين

±0.3 ثانية من ضجيج القرص الصلب؛ التواريخ والأوقات مذكورة في السجلات نفسها المنطقة الزمنية (التوقيت المركزي ما لم يُذكر خلاف ذلك؛ تستخدم سجلات DeepSeek التوقيت +08:00 وكانت (تم تحويلها).

  • الاقتباسات مأخوذة حرفياً من السجلات/الملفات المشار إليها؛ وتشير علامات الحذف إلى الأجزاء المحذوفة؛

ترد الاقتباسات الإسبانية مصحوبة بتعليقات توضيحية باللغة الإنجليزية في متن النص عند استخدامها.

  • هذه الورقة هي في حد ذاتها مسودة تم إنشاؤها بواسطة الذكاء الاصطناعي (إشعار في مقدمة الوثيقة)؛ وقد تم

وقد كُتب تحت إشراف المؤلف استنادًا إلى المصادر المذكورة أعلاه، ولم خضعت لمراجعة الأقران. أدوات التحقق: SQL المباشر، استعلامات HTTP، عمليات التحقق باستخدام متصفح بلا واجهة، وقراءة الملفات المصدرية؛ ولم يتم تقديم أي مطالبة من الذاكرة عندما كان المصدر موجودًا.

Appendix B · Glossary — plain-language terms used in this paper

How to use this glossary: the first time a technical term appears in the paper it is underlined with dots — hover it (or tap it) for a quick definition, or click it to jump here. This list is alphabetical.
  • Alignment — عملية تحديد أن كلمة في لغة ما لها نفس معنى كلمة في لغة أخرى.
  • API — واجهة تتيح لبرنامج ما أن يطلب بيانات من برنامج آخر (على سبيل المثال، تطبيق قاموس يطلب كلمة من قاعدة بيانات Lingua Mundi).
  • Autonym — الاسم الذي يطلقه المتحدثون الأصليون لهذه اللغة عليها (أما المتحدثون بالإسبانية فيطلقون على الإسبانية اسم español).
  • Bake — المصطلح المستخدم في المشروع للإشارة إلى عملية حساب إجابة معقدة مرة واحدة، وتخزينها، ثم قراءتها عدة مرات (القاعدة المتبعة هي «احفظ النتيجة، ولا تعيد حسابها»).
  • Breadth-first search — طريقة لاستكشاف الرسم البياني إلى الخارج على شكل طبقات، مثل التموجات الناتجة عن رمية حجر، بهدف إيجاد أقصر مسار بين نقطتين.
  • CJKV — اختصار لمجموعة أنظمة الكتابة التي تشمل اللغات الصينية واليابانية والكورية والفيتنامية (ترمز الحروف إلى أسماء أنظمة الكتابة هذه).
  • Concept — معنى مشترك بين اللغات (في هذه الورقة البحثية، «مفهوم القطة المنزلية»، وليس كلمة معينة).
  • Corpus — مجموعة كبيرة من البيانات اللغوية (نصوص أو مدخلات قاموسية) تُستخدم كدليل.
  • Dataset — مجموعة بيانات مجمعة من مصدر واحد، لها تنسيقها الخاص وترخيصها الخاص.
  • Derivation / etymology — الاشتقاق هو كيفية تكوين كلمات جديدة من كلمات موجودة بالفعل (run → runner)؛ أما علم أصل الكلمات فهو تاريخ الكلمة عبر الزمن واللغات.
  • ETL — استخراج-تحويل-تحميل: عملية قراءة البيانات من مصدر خارجي، وإعادة تنظيمها، وتخزينها في قاعدة البيانات.
  • FastAPI — إطار عمل مجاني ومفتوح المصدر بلغة بايثون، يُستخدم لإنشاء نوع الواجهة (API) التي يقدمها هذا المشروع.
  • Full-text search — البحث في قاعدة البيانات عن طريق مطابقة الكلمات الموجودة داخل النص المخزن بدلاً من استخدام معرّفات محددة.
  • Grapheme — حرف مكتوب: حرف من الأبجدية، أو رمز مقطع لفظي، أو حرف كانجي.
  • Graph — في هذه الورقة البحثية، مجموعة من المعاني (العقد) المرتبطة ببعضها البعض عبر علاقات محددة النوع (الحواف).
  • Gzip — طريقة ضغط قياسية تعمل على تقليل حجم الملفات قبل إرسالها عبر الإنترنت.
  • HTTP — البروتوكول الذي تستخدمه متصفحات الويب وواجهات برمجة التطبيقات (API) لطلب البيانات وتلقيها عبر الإنترنت.
  • Hypernym / taxonomy — المصطلح الأعلى = "نوع من": feline هو مصطلح أعلى من domestic cat. والتصنيف هو الشجرة الناتجة التي تضم الأنواع.
  • Importer — برنامج قادر على قراءة مجموعة بيانات خارجية واحدة وتحويلها إلى مخطط Lingua Mundi الخاص.
  • Index — هي بنية قاعدة بيانات تتيح للاستعلامات العثور على الصفوف بسرعة، تمامًا مثل فهرس الكتاب بدلاً من قراءة كل صفحة.
  • Inflection / morphology — التصريف هو تغيير صيغة الكلمة لأغراض نحوية (run → ran)؛ أما علم الصرف فهو دراسة تلك الصيغ.
  • Instance-of / part-of — نوعان من العلاقات في الرسم البياني: «هذا مثال على ذلك» (القطة هي مثال على فئة الثدييات) و«هذا جزء من ذلك» (المخلب هو جزء من القطة).
  • Interlingua — تمثيل وسيط مشترك بين اللغات: بدلاً من الترجمة من الإسبانية إلى الإنجليزية مباشرةً، ننتقل من الإسبانية إلى المعنى ثم إلى الإنجليزية.
  • ISO 639-3 — المعيار الدولي الذي يخصص لكل لغة بشرية رمزًا فريدًا مكونًا من ثلاثة أحرف (spa = الإسبانية، jpn = اليابانية).
  • JMdict / KANJIDIC2 — JMdict هو قاموس ياباني متعدد اللغات كبير الحجم؛ أما KANJIDIC2 فهو الملف المصاحب له الذي يحتوي على الكانجي (الحروف الصينية المستخدمة في اللغة اليابانية) مع طرق نطقها ومعانيها.
  • JSON Lines — تنسيق نصي بسيط حيث يمثل كل سطر سجل بيانات واحدًا، ويُستخدم في ملفات مسار العمل الأولى للمشروع.
  • Kaikki — نسخة مستخرجة من بيانات Wiktionary قابلة للقراءة آليًّا، وهي أسهل في القراءة للبرامج مقارنة بالصفحات الأصلية.
  • Kanji — الأحرف ذات الأصل الصيني المستخدمة في اللغة اليابانية المكتوبة.
  • Lemma — الصيغة الواردة في القاموس للكلمة (الصيغة التي تبحث عنها: cat، وليس cats؛ run، وليس ran).
  • Lexeme — شكل لفظي في لغة معينة (السلسلة cat).
  • License — الشروط القانونية التي تحدد كيفية استخدام البيانات ومشاركتها؛ تسمح التراخيص «المفتوحة» بإعادة الاستخدام مع ذكر المصدر (مثل CC BY-SA).
  • Long tail — الكتلة الكبيرة من العناصر النادرة في الطرف الأبعد من التوزيع الزيبفي (انظر قانون Zipf).
  • Materialized view — نتيجة استعلام مخزنة ومحسوبة مسبقًا، يتم تحديثها وفق جدول زمني محدد، بحيث لا تؤدي الأسئلة المتكررة إلى إعادة العمل (نمط «bake»).
  • Morphology — دراسة أشكال الكلمات وكيفية تغيرها من الناحية النحوية (انظر: التصريف).
  • Natural language — اللغة البشرية كما يتحدثها ويكتبها الناس فعليًّا، على عكس لغات البرمجة.
  • Node / edge — في الرسم البياني، العقدة هي عنصر واحد (وهنا: مفهوم واحد)، أما الحافة فهي الارتباط بين عنصرين (وهنا: علاقة محددة النوع).
  • OMW / Open Multilingual Wordnet — مجموعة شبكات الكلمات المُحاذاة مع شبكة WordNet الإنجليزية.
  • OPUS — مجموعة كبيرة من الجمل المترجمة التي تم جمعها من الإنترنت ومن ترجمات الأفلام.
  • Orphan sense — معنى في القاموس لم يرتبط بعد بمفهوم مشترك؛ يُترك ظاهرًا بدلاً من إخفائه.
  • Pagination — تقسيم قائمة طويلة من النتائج إلى صفحات مرقمة بدلاً من إرسالها كلها دفعة واحدة.
  • Part of speech — الفئة النحوية للكلمة: اسم، فعل، صفة، وما إلى ذلك.
  • Pipeline — سلسلة من البرامج التي تنقل البيانات من مصدرها الأولي عبر مراحل التنقية إلى وجهتها النهائية.
  • Plugin / registry — المكون الإضافي هو برنامج صغير يُضاف لمجموعة بيانات واحدة؛ أما السجل فهو القائمة المرجعية الوحيدة لهذه المكونات الإضافية.
  • Polysemy — كلمة واحدة ذات معانٍ متعددة (bank: ضفة النهر / رصيد مالي).
  • PostgreSQL — قاعدة بيانات علائقية مجانية ومفتوحة المصدر (النظام الذي يخزن Lingua Mundi كل شيء فيه).
  • Relation — ارتباط موجه ومحدد النوع بين مفهومين (القط المنزلي is a من فصيلة القطط).
  • Schema — مخطط قاعدة البيانات: الجداول الموجودة، وما يحتويه كل صف، وكيفية ارتباط الجداول ببعضها البعض.
  • Sense — معنى واحد لكلمة واحدة كما ورد في أحد القواميس.
  • Signifier / signified — وجهان للكلمة حسب سوسير: صوتها أو شكلها (المرمز) والمفهوم الذي تشير إليه (المعنى).
  • Sky brightness / magnitude — تصنيف المشروع لمدى «أهمية» المعنى، استنادًا إلى عدد اللغات والكلمات المرتبطة به.
  • SQL — اللغة القياسية لطرح الأسئلة على قاعدة البيانات العلائقية.
  • Synset — مجموعة من الكلمات التي يمكن أن تعبر عن المعنى نفسه في سياق معين؛ وفي Lingua Mundi، يُخزَّن معنى مجموعة المرادفات (synset) كمفهوم.
  • Token — في مجال التعلم الآلي، هي الجزء الصغير من النص (غالبًا كلمة أو جزء من كلمة) الذي يقرأه النموذج أو يكتبه.
  • Treebank — مجموعة من الجمل الحقيقية المُرفقة بتوضيحات نحوية (أي دور تقوم به كل كلمة).
  • UD / Universal Dependencies — مشروع مجتمعي ينشر بيانات جمل مزودة بتعليقات نحوية بالعديد من اللغات بموجب تراخيص مفتوحة.
  • UniMorph — مستودع متعدد اللغات لبيانات أشكال الكلمات (الصرفية).
  • URI — عنوان ثابت وفريد لكل كائن، ويُستخدم هنا للإشارة إلى المفاهيم (مثل princeton-wordnet:02121620-n للإشارة إلى القطة المنزلية).
  • Wikidata — قاعدة المعرفة المنظمة التابعة لويكيميديا، والتي تضم بيانات مزودة بمعرّفات قابلة للقراءة آليًّا، وقد تم إصدارها بموجب ترخيص CC0.
  • Wiktionary — القاموس التعاوني الذي تستضيفه مؤسسة ويكيميديا.
  • Word form — إحدى طرق تهجئة كلمة ما في إحدى اللغات؛ انظر «الوحدة اللغوية».
  • WordNet — قاعدة البيانات المعجمية الأصلية المرتبة حسب المعنى باللغة الإنجليزية (برينستون)؛ ويقوم مشروع «أومو» (OMW) بمواءمة اللغات الأخرى معها.
  • Wordfreq — قاعدة بيانات تضم قوائم بتكرار الكلمات عبر اللغات المختلفة، تُستخدم لترتيب الكلمات حسب مدى شيوعها.
  • Writing script — مجموعة الأحرف التي تُكتب بها لغة ما (الأحرف اللاتينية، العربية، الصينية، وما إلى ذلك).
  • Zipf's law — الملاحظة التي تفيد بأن بضع كلمات تشكل معظم الاستخدامات، بينما تشكل «الذيل الطويل» للكلمات النادرة الباقي.