Lingua Mundi: la construcción de un mapa de significados independiente del idioma a partir de datos léxicos abiertos

Una idea en cada idioma, en una sola estrella.

Historia del proyecto y memoria técnica · Borrador preliminar generado por IA · RHLS studio · 7 de septiembre de 2026

Tienda RHLS · Lingua Mundi · Blog · English audio · English · Español · Français


Aviso: borrador preliminar generado por IA. Este documento fue redactado por un agente de investigación de inteligencia artificial (que opera dentro de la cadena de herramientas "DeepSeek Harness" de RHLS) por indicación de Raciel Hernández Hernández, el autor del proyecto. No es la publicación final: el artículo autoritativo, escrito por humanos, todavía está en desarrollo por parte del Sr. Hernández. Todo dato, cifra y cita de este borrador se remonta a una fuente primaria fechada (registros de conversaciones con ChatGPT, Claude y DeepSeek; diarios de proyecto y registros de sesión; el repositorio de software y su documentación; y mediciones directas de la base de datos en vivo y de la interfaz de programación de aplicaciones), y las fuentes se enumeran en el apéndice. Las afirmaciones que no pudieron verificarse están marcadas explícitamente. Ninguna afirmación de este borrador debe tratarse como revisada por pares ni como redacción definitiva.

Cómo leer este artículo. Está escrito para personas que no son lingüistas computacionales ni programadoras. La primera vez que aparece un término técnico se marca con un subrayado punteado: pase el cursor sobre él (o tóquelo) para ver una definición en lenguaje sencillo, o haga clic para saltar al glosario completo (Apéndice B). Cada cita y cada herramienta o fuente de datos nombrada está enlazada con su fuente primaria o su documentación oficial. Los lectores que solo quieran la historia pueden leer las secciones 1–3 y la 10; las secciones intermedias documentan la ingeniería en detalle.

Declaración de autoría y contribución. Lingua Mundi fue concebida, diseñada y está siendo construida por Raciel Hernández Hernández, investigador independiente y traductor radicado en Tabasco, México. El desarrollo se lleva a cabo como una colaboración dirigida por humanos con grandes modelos de lenguaje comerciales —ChatGPT de OpenAI, Claude de Anthropic y los modelos de chat y de razonamiento de DeepSeek—, que el autor utiliza como compañeros de programación, revisores y ayudantes de documentación. Este borrador en sí fue escrito por un agente de IA bajo la dirección del autor y sigue las convenciones de verificación del estudio: [H] marca un dato verificado contra una fuente fechada, una medición o un código; [O] marca una interpretación u opinión atribuida; [NV] marca una afirmación que no pudo verificarse. El texto público se escribe en la voz del estudio, no en la voz personal del autor, según la convención del estudio.

[H] Regla de la voz del estudio (registro de sesión, 7 de septiembre de 2026): «Voz de estudio/PR en todo el texto externo o de presentación — nunca la voz personal de Rex». [H] Regla de honestidad: «Sin mentiras / sin falsa confianza» (convenciones del estudio, septiembre de 2026).

Resumen

Los diccionarios humanos y los WordNets se organizan por idioma: un archivo de palabras en español, uno en inglés, uno en japonés. Pero un significado como «gato doméstico» no es español, inglés ni japonés: lo comparten todos ellos, y cada idioma solo lo señala con una forma superficial distinta: gato, cat, chat, Katze, . Lingua Mundi («lengua del mundo») es una base de conocimiento léxico abierta, gratuita e independiente del idioma que intenta invertir la organización habitual: en lugar de un diccionario por idioma, almacena los conceptos (significados) una sola vez y adosa a esos significados compartidos las palabras de cada idioma, usando como clave de alineación los WordNets multilingües de la comunidad de datos abiertos. El proyecto lo desarrolla una sola persona, en una sola computadora portátil de la era 2014 (un procesador de cuatro núcleos clase Intel Pentium, 8 GB de RAM, un disco duro de 5400 rpm y una conexión lenta a internet — la máquina que aloja el sistema en vivo, capturada directamente para este artículo; véase la sección 9.1), con un presupuesto de cero, usando solo datos léxicos abiertos. Entre diciembre de 2025 y septiembre de 2026, el proyecto pasó de una carpeta de archivos de diccionario descargados a una base de datos PostgreSQL en funcionamiento con 96,434 conceptos, 1,238,383 formas de palabra (lexemas), 1,608,018 sentidos de palabra y 171,672 relaciones semánticas en seis idiomas en vivo (inglés, español, francés, alemán, portugués y japonés), una API de consulta que responde en milisegundos y una interfaz web presentada como un «mapa de significados» — un mapa estelar explorable en el que una estrella puede ser a la vez cat · gato · 猫 · chat · Katze. Este artículo documenta el origen intelectual del proyecto (la intuición de que el significado, no la grafía, es la unidad natural de los datos lingüísticos multilingües); los principios matemáticos y lingüísticos de su diseño (un modelo de entidades independiente del idioma, la alineación de conceptos basada en synsets, una taxonomía de relaciones tipadas, la clasificación zipfiana y un patrón de vista materializada de «hornear, no volver a derivar», tomado de la práctica de las bases de datos); las fuentes de datos abiertos y sus licencias; las herramientas y el flujo de trabajo humano-IA con que se construyó; la interfaz de usuario y su diseño pedagógico; los fallos de infraestructura descubiertos en el camino — incluido un error silencioso de truncamiento que durante un tiempo hizo invisible la palabra inglesa cat para su propio concepto (su cadena de reparación, lanzada el 7 de septiembre de 2026 y verificada como completa el 8 de septiembre de 2026); el estado actual del proyecto; y sus planes. El artículo es también, implícitamente, un estudio de caso sobre lo que una persona decidida puede construir con datos abiertos, herramientas gratuitas y cómputo prestado — y sobre los hábitos de ingeniería (medir, fechar, etiquetar, admitir lo que no está verificado) que hacen que un proyecto pequeño sea lo bastante honesto como para crecer hasta convertirse en uno grande.

Las cifras y estadísticas de este resumen se midieron del 6 al 7 de septiembre de 2026; véase el Apéndice A para las consultas, fechas y fuentes exactas.

96,434conceptos · significados
1,238,383formas de palabra · lexemas
1,608,018sentidos de palabra
171,672relaciones semánticas
6idiomas en vivo
0.25 scielo por defecto · en caliente
Borrador preliminar generado por IA. Este documento fue redactado por un agente de investigación de inteligencia artificial bajo la dirección de Raciel Hernández, autor del proyecto. No es la publicación final — el artículo de autoría humana sigue en desarrollo — y no ha sido revisado por pares. Cada dato y cifra remite a una fuente primaria fechada que se lista en los apéndices; las afirmaciones no verificadas están marcadas explícitamente. No citar sin la aprobación del autor.

1 · La intuición: por qué los diccionarios tienen la forma equivocada

One concept, six languages: the domestic-cat synset 02121620-n 02121620-n domestic cat EnglishcatgrimalkinhousecatmouserpussSpanishgatoFrenchchatchatteGermanKatzeKaterPortuguesegatobichanoJapaneseネコ
One concept, six languages — members of the domestic-cat synset princeton-wordnet:02121620-n (verified subset, September 2026).

Todo estudiante de idiomas ha sentido esa fricción. Uno busca cat en un diccionario inglés–español y encuentra gato. Busca gato en un diccionario español–japonés y encuentra . Tres diccionarios después, uno ha pasado una tarde confirmando lo que ya sospechaba: la misma idea —un pequeño carnívoro doméstico que ronronea— se está describiendo tres veces, en tres archivos separados, por tres organizaciones diferentes, con tres identificadores diferentes, y jamás conectada con las otras dos.

La intuición que subyace a Lingua Mundi es que esta es la forma equivocada de organizar los datos lingüísticos. El significado existe una sola vez. Las palabras existen muchas veces. Una base de datos que almacene los significados como objetos de primera clase y trate a las palabras como etiquetas que los distintos idiomas adosan a esos significados permitiría a una persona (o a un programa) pasar de cualquier idioma a cualquier otro a través de un único mapa compartido — y permitiría al estudiante ver de un vistazo que cat, gato, chat, Katze y no son cinco datos que memorizar, sino un solo dato con cinco abrigos.

Esta intuición no llegó como un rayo. Creció, a lo largo de aproximadamente un año, a partir del trabajo cotidiano de una persona en particular — y el rastro documental más temprano de ella es notablemente sencillo.

1.1 El primer mensaje

El 3 de diciembre de 2025, el autor abrió una conversación con ChatGPT y escribió lo siguiente (citado textualmente; la conversación permaneció abierta durante cuatro meses y medio y se editó por última vez el 21 de abril de 2026) [H]:

«Quiero encontrar diccionarios gratuitos similares a JMDICT y Kanjidict2 para los siguientes idiomas: español, inglés, francés, italiano, portugués, chino, coreano y vietnamita. Mi intención es crear una base de datos multilingüe unificada para diversos fines. También me interesa saber si existen bases de datos similares para lenguas indígenas mexicanas a las que pueda acceder libremente».

(Registro de sesión, ChatGPT, conversación "Free multilingual dictionaries", 2025-12-03; el archivo fuente se cita en el Apéndice A.)

Tres cosas de ese breve mensaje prefiguran todo lo que el proyecto llegaría a ser. Primero: los idiomas nombrados —español, inglés, francés, italiano, portugués y, más tarde, japonés— son exactamente los idiomas que el autor habla y con los que trabaja como traductor y profesor de idiomas (un conjunto que más adelante formalizaría como el «Core 6»), más el chino, el coreano y el vietnamita, que planeaba añadir a continuación. Segundo: la frase «una base de datos multilingüe unificada» ya nombra la meta: no seis diccionarios, sino una sola base de datos que los contenga a todos juntos. Tercero: el autor pensaba en las lenguas indígenas de México desde el primer día — un hilo que reaparece una y otra vez (en agosto de 2026 se exploró una integración en lengua maya para Lingua Mundi [H], y los recursos en lenguas mayas aparecen a lo largo de sus notas de investigación).

El contexto detrás de ese mensaje también importa. El autor no es informático de formación. Es traductor y tutor de idiomas que por entonces también estaba aprendiendo japonés en serio y construía pequeñas herramientas para hacer ese aprendizaje más fácil: juegos de aprendizaje de kanji y kana, y un pipeline (canal de importación) de diccionarios de japonés (un editor de furigana para libros electrónicos en japonés se sumaría a esta caja de herramientas más tarde, en 2026, como el proyecto que dio origen a la aplicación Shikibu). Su directorio personal a finales de 2025 muestra la arqueología de ese aprendizaje: una copia del archivo de diccionario de kanji KANJIDIC2 descargado el 11 de noviembre de 2025, una lista de kanji jōyō en diciembre y, después —impulsado por aquella conversación del 3 de diciembre—, los datos del Open Multilingual Wordnet descargados el 5 de diciembre [H] (marcas de tiempo de los archivos, /home/rex/; véase el Apéndice A). La conversación de ChatGPT del 3 de diciembre, en otras palabras, es la bisagra: el momento en que «necesito datos de japonés para mis herramientas» se amplió hasta convertirse en «quiero construir una base de datos multilingüe unificada, gratuita, para muchos idiomas, incluidos los idiomas de mi propio país».

1.2 De los diccionarios a los significados: el canal de importación de diciembre de 2025

Lo que el autor hizo después es visible en los archivos que creó. Entre el 5 de diciembre y el 16 de diciembre de 2025 escribió, con ChatGPT como compañero de programación, un pequeño canal de importación de scripts de Pythonextract_omw.py, merge_dicts.py, unified_dictionary_pipeline.py, crossref_deterministic.py — que descargaba, analizaba y fusionaba datos léxicos de varias fuentes abiertas en formas progresivamente más estructuradas [H] (scripts y fechas en /home/rex/). La decisión de diseño más importante de este periodo está documentada en los propios archivos: la etapa final del canal, fechada el 16 de diciembre, divide cada entrada en cuatro tipos de objetosconcept, sense, lexeme y grapheme (un grafema es un carácter escrito, como un kanji) — y los escribe en disco como documentos JSON Lines. El esquema es revelador: un sense es un significado particular de una palabra particular en un diccionario particular; un concept es la idea compartida a la que apuntan varios sentidos de varios idiomas; y al campo concept_id de un sentido se le permite estar vacío — es decir, «este sentido de palabra aún no se ha vinculado a un concepto compartido». Las notas del autor en ese código describen el método como «cero heurísticas»: nada de conjeturas difusas ni trucos de similitud estadística para decidir que dos palabras significan lo mismo; solo vínculos explícitos y documentados. [H] (código del canal y anotaciones, /home/rex/, diciembre de 2025; detalles en el Apéndice A.)

Ese esquema del 16 de diciembre es, en miniatura, la arquitectura completa del proyecto que más tarde se llamaría Lingua Mundi: las palabras viven en los idiomas; los significados viven en un espacio compartido; y el problema difícil y honesto —qué palabra de qué idioma significa qué concepto— nunca se finge. Un sentido que no se ha vinculado a un concepto se conserva en la base de datos, visiblemente desvinculado, en lugar de ser colocado en su sitio por una conjetura silenciosa. Diez meses después, cuando un error en un canal de importación hizo invisible la palabra inglesa cat para su propio concepto, el autor describiría el principio en exactamente estos términos: mejor mostrar un sentido huérfano que ocultarlo ([H]; véase la sección 7).

1.3 El vacío y la expansión

Entonces el rastro documental se silencia durante unos cinco meses: desde mediados de diciembre de 2025 hasta finales de mayo de 2026, los registros disponibles no contienen ningún trabajo en el canal de importación de diccionarios [NV]. Esto no es inusual para un traductor en activo con alumnos a los que enseñar, pero vale la pena decirlo sin rodeos: el crecimiento del proyecto no fue continuo. Avanzó a ráfagas, separadas por semanas o meses de otro trabajo — un ritmo que continuaría a lo largo de 2026.

Cuando el hilo se retoma, la ambición se ha ampliado. El 1 de mayo de 2026 el autor estudia "OMW v2.0 data coverage" (la cobertura de datos de la versión 2.0 del Open Multilingual Wordnet) [H] (título y contenido de la conversación, ChatGPT, 2026-05-01). El 27 de mayo de 2026 abre una conversación titulada "Open Source Language Resources" y pide, en efecto, un mapa sistemático de todo recurso léxico, gramatical y semántico gratuito que pudiera alimentar una base de conocimiento multilingüe [H] (ChatGPT, 2026-05-27). Para entonces el proyecto ya tiene nombre y forma; la evidencia de ambos aparece en el próximo capítulo.

1.4 Por qué esto importa más allá del proyecto de una persona

El lector puede preguntarse por qué un artículo debería documentar con tanto detalle la intuición de un proyecto personal. La respuesta es que la intuición es la contribución. La idea de que los significados —no las grafías— son la unidad natural de los datos multilingües tiene un largo pedigrí académico (es el sueño más antiguo de la tradición de la «interlingua» en la traducción automática y el principio organizador de los synsets de Princeton WordNet; véase la sección 2), pero rara vez la pone en práctica un individuo, sin presupuesto, como un bien público. La mayoría de los recursos multilingües que siguen este principio —el Open Multilingual Wordnet, BabelNet, el proyecto Universal Dependencies— son mantenidos por consorcios universitarios con financiación mediante subvenciones. Lingua Mundi es el intento de un investigador independiente, usando solo datos abiertos y herramientas gratuitas, de construir él mismo una pieza de esa infraestructura para su propio trabajo de traducción y docencia — y de regalarla. Si ese intento tendrá éxito es una pregunta que el lector puede juzgar a partir de la evidencia del resto de este artículo — y los propios diarios del autor lo muestran haciéndose la misma pregunta, con la misma honestidad, todo el tiempo (véase la sección 4.3).

2 · Antecedentes: qué significa «un mapa de significados»

Para entender qué intenta construir Lingua Mundi y qué hay genuinamente nuevo en ello, importan tres líneas de trabajo previo: la idea lingüística de que el significado puede separarse de la grafía; la idea computacional de que ese significado puede almacenarse como datos y vincularse entre idiomas; y la observación moderna de que un mapa estructurado de significados complementa a los modelos neuronales de lenguaje —en lugar de competir con ellos—.

2.1 El signo y sus dos caras

La lingüística moderna comienza con una observación engañosamente simple, atribuida por lo general a las conferencias de Ferdinand de Saussure de principios del siglo XX: una palabra es el emparejamiento de un sonido/forma (el «significante») con un concepto (el «significado») (de Saussure, 1916/1983). Dos idiomas, bajo esta visión, no son dos conjuntos de palabras que casualmente se traducen; son dos conjuntos de significantes que se superponen parcialmente sobre un espacio compartido de significados. El significante inglés cat y el significante español gato son formas distintas con el mismo significado. Si una máquina pudiera almacenar los significados una sola vez y adosarles los significantes, la traducción se convertiría en una búsqueda a través de un punto intermedio compartido — una idea conocida en la traducción automática como el enfoque de la interlingua: en lugar de traducir directamente inglés→español, traducir inglés→significado→español.

El sueño de la interlingua tiene una larga historia en la investigación de la traducción automática y, repetidamente, demostró ser demasiado difícil en toda su generalidad (los idiomas no recortan el significado en piezas idénticas, y todo traductor sabe que cat el animal y cat el músico de jazz son significados distintos que visten un solo significante). Pero el sueño nunca murió; simplemente se acotó hasta volverse algo construible: el léxico, la parte del idioma que mejor se corresponde con significados estables y compartidos.

2.2 WordNet y el synset

El recorte decisivo vino de la psicología y de la lexicografía. En las décadas de 1980 y 1990, George Miller y sus colegas de Princeton construyeron WordNet, una base de datos léxica del inglés organizada no alfabéticamente sino semánticamente (Miller, 1995; Fellbaum, 1998). La invención central de WordNet es el synset (una contracción de "synonym set", es decir, «conjunto de sinónimos»): un grupo de palabras que pueden designar el mismo significado en algún contexto. El synset {cat, true cat, Felis catus, domestic cat} es un significado; el synset {cat, kat, guy, hombre} —con el sentido de «término informal para un joven o un hombre»— es otro significado, bastante distinto, que casualmente comparte el significante cat. WordNet también registra relaciones entre synsets —la más importante, la jerarquía es-un (hiperonimia: un gato doméstico es un felino, un felino es un carnívoro, un carnívoro es un* mamífero…)—, lo que convierte el diccionario en un grafo, con los significados como nodos y las relaciones tipadas como aristas.

WordNet importa a Lingua Mundi por tres razones. Primera: demostró que un léxico legible por máquina y organizado por significado es factible y enormemente útil — los buscadores modernos, los correctores ortográficos y las bibliotecas de procesamiento de lenguaje natural todavía se apoyan en él. Segunda: le dio al mundo un sistema de identificadores estables para los significados: Princeton WordNet numera sus synsets, de modo que 02121620-n designa sin ambigüedad «gato doméstico» y puede citarse entre bases de datos. Tercera: se convirtió en el ancla de un proyecto multilingüe: el Open Multilingual Wordnet (OMW).

2.3 El Open Multilingual Wordnet: un significado, muchos idiomas

El OMW, lanzado por Francis Bond y Ryan Foster (Bond & Foster, 2013), reúne los WordNets construidos en muchos idiomas y los alinea con el WordNet inglés de Princeton: los synsets de cada idioma participante llevan punteros al synset inglés con el que se corresponden. El resultado es el recurso que hizo posible Lingua Mundi: un conjunto de afirmaciones explícitas, curadas por humanos, de la forma «el gato español (sentido 1) pertenece al mismo significado que el synset inglés domestic-cat 02121620-n». Cuando el autor de Lingua Mundi escribió en su especificación de ingeniería de julio de 2026 que el proyecto sería «synset-centric» (centrado en synsets) y que alinearía los idiomas a través del OMW [H] (documento de especificación, 24 de julio de 2026), estaba parado sobre los hombros de Bond y Foster — como ya lo habían estado, desde diciembre de 2025, sus scripts del canal de importación, que analizaban directamente los archivos de datos del OMW.

2.4 El ecosistema de datos abiertos en torno a los WordNets

El OMW es un nodo más de un ecosistema amplio, con licencias abiertas, que un individuo puede combinar legal y técnicamente:

alojado por la Fundación Wikimedia — ofrece una cobertura léxica muy amplia en cientos de idiomas, incluidas definiciones, traducciones, flexiones y pronunciación, bajo licencias share-alike (Wikimedia Foundation; véase también Meyer & Gurevych, 2012, sobre su valor como rival de los léxicos de expertos).

estructurado de Wikimedia — almacena afirmaciones con identificadores legibles por máquina y se publica bajo CC0 (dominio público) (Vrandečić & Krötzsch, 2014).

proyecto comunitario que publica treebanks de oraciones con anotación sintáctica en más de un centenar de idiomas, bajo licencias abiertas (Nivre et al., 2020). UD aporta oraciones reales e información sobre categorías gramaticales (part-of-speech) — evidencia de cómo se usan de hecho las palabras.

diccionario de japonés y de kanji mantenidos por el proyecto EDRDG de Jim Breen, que cubren el japonés de manera extensa y con traducciones a varios idiomas (Breen, 2004). Fueron los puntos de partida del autor (su primer archivo de diccionario, descargado en noviembre de 2025, fue KANJIDIC2 [H]).

  • UniMorph — un repositorio multilingüe de

morfología flexiva (formas de palabra como run/ran/running organizadas por rasgo gramatical) (Kirov et al., 2018; McCarthy et al., 2020).

  • OPUS — una gran colección de oraciones

paralelas (traducidas) extraídas de la web y de los subtítulos de películas, con licencias abiertas (Tiedemann, 2012).

ordenan las palabras según lo comunes que son en corpus reales.

  • El estándar ISO 639-3, que asigna a cada idioma humano un código estable

de tres letras (p. ej., spa para el español, jpn para el japonés), mantenido por SIL International — la base de datos de Lingua Mundi usa estos códigos como claves de su tabla language [H].

Dos propiedades de este ecosistema merecen énfasis porque estructuran todo el proyecto. Primera: las licencias son genuinamente abiertas —permisivas o share-alike—, de modo que combinarlas en una base de datos derivada es legal siempre que se respeten la atribución y los términos de las licencias (Lingua Mundi registra la fuente y la licencia de cada conjunto de datos importado en su propia tabla source; véase la sección 6). Segunda: el ecosistema es complementario: Wiktionary es amplio pero poco profundo; los WordNets son profundos pero estrechos; UD trata del uso; UniMorph trata de las formas de palabra; las listas de frecuencia tratan de la prominencia. El problema de ingeniería de Lingua Mundi no es «encontrar datos», sino «fusionar datos que nunca fueron diseñados para fusionarse, sin mentir sobre las uniones».

2.5 Por qué un mapa de significados sigue importando en la era de los grandes modelos

Una objeción razonable debe plantearse con franqueza: si los grandes modelos de lenguaje ya pueden traducir, definir y razonar sobre las palabras, ¿para qué construir un léxico estructurado? La respuesta del autor de Lingua Mundi, desarrollada en su artículo de investigación de junio de 2026 (sección 3) y refinada a lo largo del verano, tiene tres partes. Primera: verificabilidad — una base de datos estructurada puede mostrar su trabajo: cada vínculo tiene una fuente, una licencia y una fecha; en cambio, el conocimiento de un modelo es una mezcla estadística opaca que no se puede auditar, corregir ni citar. Segunda: costo y acceso — consultar una base de datos local no cuesta nada y funciona sin conexión, mientras que cada consulta a un modelo cuesta energía, dinero o ambas cosas; la regla de diseño permanente del autor es la de las «consultas de investigación de cero tokens»: la API local es la superficie de investigación [H] (nota de proyecto, 29 de agosto de 2026). Tercera: complementariedad — el artículo de junio de 2026 sostenía, como hipótesis, con las auditorías de tres modelos convergiendo en el mismo veredicto, que un modelo compacto que operara sobre identificadores de concepto, en lugar de sobre tokens brutos, podría ser mucho más eficiente precisamente porque el mapa de conceptos hace el trabajo semántico fuera de la red (véase la sección 3). Tanto si esa hipótesis sobrevive a la experimentación como si no, el mapa sigue siendo útil para los modelos: como una memoria externa que puede consultarse, actualizarse y citarse sin reentrenamiento.

El linaje intelectual de Lingua Mundi puede resumirse, pues, en una sola línea: es el sueño de la interlingua, acotado al léxico por WordNet, hecho multilingüe por el OMW, hecho legal por el movimiento de datos abiertos y hecho personal por la necesidad de un traductor de contar con un diccionario que trate el significado —y no el idioma— como lo que se archiva.

3 · El nombre, la tesis y la arquitectura de siete grafos (mayo–junio de 2026)

3.1 El nombre

A finales de mayo de 2026, las notas y especificaciones del autor usaban el título provisional "Multilingual Lexical Platform" [H] (documento maestro de especificación en markdown, fechado el 23 de mayo de 2026, /home/rex/Descargas/Phone backup/Download/). El nombre Lingua Mundi — «lengua del mundo» en latín — aparece por primera vez en el registro disponible el 1 de junio de 2026, como título de un manuscrito de investigación (véase más abajo) [H] (registros de conversación, 1 de junio de 2026; primera aparición verificada en los archivos del autor). El nombre es apropiado: la pretensión del proyecto no es contener muchos idiomas, sino estar acerca del único espacio de significado que esos idiomas comparten.

3.2 Una tesis de investigación: el significado, no los tokens

Entre marzo y junio de 2026, aproximadamente, el autor desarrolló —en conversación con ChatGPT, Claude y DeepSeek— una tesis de investigación sobre por qué un mapa del lenguaje a nivel de conceptos podría hacer la tecnología del lenguaje radicalmente más eficiente y accesible. La tesis, en el encuadre de trabajo que el autor llevó a la conversación (citada textualmente de su solicitud de viabilidad del 18 de julio de 2026, donde pegó la descripción para su revisión) [H]:

«Crea un mapa multilingüe, abierto y legible por máquina del lenguaje humano que separe: 1. Significado · 2. Forma · 3. Estructura · 4. Historia · 5. Uso — en grafos interoperables. El objetivo a largo plazo es hacer que el lenguaje sea computable a nivel de conceptos y no a nivel de tokens. […] El NLP moderno modela en gran medida: token → token. Lingua Mundi modela: concepto ↔ idioma».

El argumento subyacente, expuesto en el manuscrito de junio, es que un modelo de lenguaje gasta la mayor parte de su capacidad en la variación superficial —tratar "dog", "perro" y "犬" como tres cosas sin relación cuando son una sola cosa con tres abrigos— [H] (manuscrito V4, citado en su totalidad en la conversación de auditoría del 1 de junio de 2026). Si un modelo pudiera, en cambio, leer y escribir secuencias de conceptos —con el mapa de conceptos haciendo el trabajo multilingüe fuera de la red—, el modelo podría ser más pequeño, más barato y ejecutable en computadoras comunes.

3.3 Siete versiones en una mañana: el método de colaboración adversarial

El manuscrito, titulado Lingua Mundi: A Semantic Infrastructure for Concept-Grounded Language Models, proponía una arquitectura de siete capas: un grafo de conceptos (significados independientes del idioma, con tamaño objetivo de mil millones de nodos), un grafo de synsets (que mapea las palabras de cada idioma sobre conceptos) y grafos para la morfología, la derivación, la etimología, la correspondencia entre idiomas y el uso —unidos todos por un sistema de identificadores común—; más una arquitectura de modelo anclada en conceptos (un modelo secuencial de estilo Mamba que lee identificadores de concepto), incrustaciones hiperbólicas (bola de Poincaré) para el grafo de conceptos, recuperación explícita de hechos desde el grafo y un presupuesto auditado que muestra que todo cabe en computadoras portátiles comunes [H] (manuscrito, 1 de junio de 2026).

Lo que hace notable este episodio como método —y de un modo inusualmente bien documentado— es que el autor no escribió el manuscrito solo. En la mañana del 1 de junio de 2026 hizo pasar el borrador por siete revisiones sucesivas (V1–V7) en menos de media hora, usando dos modelos de forma adversarial: DeepSeek redactaba cada revisión mientras ChatGPT auditaba cada borrador con el rigor de un revisor par hostil [H] (registros de conversación, DeepSeek "Revisión y corrección del proyecto Lingua Mundi" y ChatGPT "Audit Feedback Lingua Mundi", ambos del 1 de junio de 2026). Las transcripciones de las auditorías se conservan textuales y son inusualmente francas sobre lo que arregló cada ronda:

  • se corrigió la aritmética del almacenamiento de embeddings INT8 (un error de

un factor de dos en el presupuesto de almacenamiento);

  • se eliminó una afirmación empírica fabricada ("empirically, we find…") y se

sustituyó por una hipótesis etiquetada explícitamente como tal y fundamentada en trabajo previo;

  • se sustituyó una comparación contra un modelo hipotético futuro por una

comparación contra un modelo real (DeepSeek-V3);

  • las afirmaciones de rendimiento del resumen se fueron acotando

progresivamente;

  • las afirmaciones de escalado sin respaldo se reetiquetaron como problemas

abiertos de investigación; y

  • el manuscrito se reencuadró, para V7, de afirmación empírica a un documento

de posición honesto — una agenda de investigación con un plan de evaluación explícito y falseable (robustez en desambiguación de sentidos de palabra, ablaciones, líneas base).

Los veredictos finales de las auditorías, conservados en los registros, valoraron muy alto la visión del manuscrito mientras calificaban de baja, de forma consistente, la evidencia empírica — y la recomendación final de la última auditoría fue contundente [H]:

«Si yo asesorara el proyecto, en este momento giraría de la escritura del artículo a la implementación. El siguiente artefacto valioso no es V8: es Lingua Mundi Prototype 0.1 … con: 100k–1M conceptos, solo inglés, tokenizador de conceptos, reconstrucción de conceptos, ejecución de entrenamiento TinyStories, comparación directa contra token-Mamba. Ese experimento respondería la pregunta central: ¿la compresión semántica conserva suficiente información como para justificar el cuello de botella?»

El autor siguió ese consejo. Tres observaciones sobre este episodio importan para entender todo lo que siguió. Primera: la idea nunca fue el cuello de botella —el autor tenía, en sus propias palabras, una visión que las auditorías calificaron con A−; el cuello de botella era la evidencia, y las auditorías lo dijeron siete veces—. Segunda: el método de trabajo del autor —usar varios modelos de IA como colaboradores adversariales, conservar cada borrador y cada auditoría y preferir la calificación honesta a la sobreafirmación segura— se convirtió en el estándar permanente del estudio, y es el mismo método que se ve en las convenciones de verificación [H]/[O]/[NV] del presente artículo (Apéndice A). Tercera: la arquitectura de siete capas de aquel manuscrito de junio no desapareció cuando el autor giró hacia la implementación: se convirtió en la hoja de ruta del proyecto. El Lingua Mundi que existe hoy (septiembre de 2026) implementa el grafo de conceptos, el grafo de synsets, la importación de morfología, las capas de corpus y una API; las capas de derivación, etimología, correspondencia y uso son fases explícitamente encoladas del mismo plan (secciones 5–6 y 10.3) [H] (hoja de ruta del proyecto, 29 de agosto de 2026).

4 · La plataforma toma forma (julio–agosto de 2026)

4.1 Viabilidad: «¿puede hacerse esto con componentes de código abierto?»

El 18 de julio de 2026, el autor le preguntó a ChatGPT, sin rodeos, si la visión podía construirse a partir de componentes gratuitos existentes y qué necesitaría para desarrollarla [H] (conversación "Lingua Mundi Project Feasibility", 2026-07-18, 00:44 UTC — la noche del 17 de julio en la zona horaria central del autor). La conversación —y las semanas que siguieron— registran el giro de artículo de investigación a programa de ingeniería. El proyecto adoptó la declaración formal de misión que el autor pegó en esa conversación para su revisión (citada en la sección 3.2), y el autor comenzó a levantar el andamiaje del código real: existen en disco archivos de esquema del modelo de datos fechados el 17 de julio de 2026 [H] (instantáneas de código, julio de 2026; véase el Apéndice A).

4.2 La especificación de ingeniería (24 de julio de 2026)

El 24 de julio de 2026, el autor consolidó el diseño en una especificación de ingeniería de 104 páginas, Multilingual Lexical Platform — Engineering Specification, versión 2.0, con el subtítulo "Revised & Production-Ready" [H] (PDF, /home/rex/, 24 de julio de 2026; texto extraído para este artículo). La especificación es la constitución del proyecto, y su contenido explica la mayor parte de lo que después se construyó:

  • El principio centrado en synsets. El documento establece que todo objeto

léxico debe adosarse en última instancia a un synset (un significado) y que la base de datos se organiza alrededor de los significados, no de las grafías. Su ejemplo desarrollado es la palabra bank, que debe ser una sola forma superficial con varios synsets distintos ("river bank", "financial institution", "to bank on something") — nunca un único bloque de significados indiferenciados [H].

  • Niveles de idiomas. La especificación planeaba los idiomas en dos

niveles: Nivel 1 para el lanzamiento —inglés, español, francés, portugués, japonés y chino mandarín (simplificado y tradicional)— y Nivel 2 —italiano, coreano y vietnamita— [H]. (El conjunto que en realidad se publicó en la base de datos difiere en dos aspectos interesantes, documentados en la sección 10: los seis en vivo son inglés, español, francés, alemán, portugués y japonés —faltan el mandarín y el italiano, y está presente el alemán. La sustitución no está explicada en ningún lugar de los registros sobrevivientes [NV], una admisión franca de una cuestión de procedencia sin resolver.)

  • El modelo de datos. El capítulo 5 de la especificación esboza el esquema

en términos generales, y el modelo que se publicó en la primera migración del repositorio es un núcleo de once tablas que corresponde a la intuición de cuatro entidades del prototipo de diciembre de 2025, ahora formalizada: idiomas, lexemas, sentidos, conceptos (synsets), relaciones, fuentes, synsets y tablas de apoyo (véase la sección 5).

  • Una jerarquía de alineación de cinco niveles. Como el enlace automático

y el manual de palabras con conceptos difieren en confiabilidad, la especificación propuso cinco niveles de confianza de alineación, desde los vínculos explícitos declarados por la fuente (p. ej., los mapeos del OMW) hasta las conjeturas heurísticas — con la regla de que cada vínculo almacenado lleva su nivel de confianza. Esta es la forma madura de la regla de «cero heurísticas» de diciembre de 2025: no se trata de que no exista el enlace automático, sino de un enlace etiquetado y honesto [H].

  • Una hoja de ruta por fases con compuertas. Fases 0–5, cada una con un

criterio de salida, del esquema y el ETL a la API y a las aplicaciones.

  • Un registro de riesgos — que incluye un anexo de autocrítica en el que

se proponen capas de etimología y de CJKV/Unihan y se advierte sobre los «falsos amigos» japonés–chino (p. ej., 娘 «hija» en japonés frente a «madre» en chino; 手紙 «carta» frente a «papel higiénico») [H].

La especificación también fijó la pila tecnológica que el proyecto más tarde simplificaría: FastAPI, PostgreSQL, un motor de búsqueda (Meilisearch en la especificación) y un frontend web (Next.js). Notablemente, ya para el 13 de agosto el autor estaba cuestionando esa pila él mismo (sección 4.4).

4.3 El diario de julio: pensar en el sistema operativo semántico

Por los mismos días, el diario privado del autor (knowledge project.txt, 85 KB, leído completo para este artículo; marca de tiempo del archivo: 18 de julio de 2026, una sola sesión de trabajo) registra un hilo relacionado y más personal: su intento de pensar a fondo un «grafo semántico universal» —una forma independiente de la notación de representar el significado que funcionara a través de los lenguajes de programación, la teoría musical, la química y el lenguaje natural (un proyecto aparte que llamó USG)— [H] (diario, julio de 2026). El pasaje del diario más relevante para Lingua Mundi (líneas 2563–2587) es su reflexión sobre lo que significaría representar un objeto semántico en tres idiomas a la vez —la misma intuición que cat · gato · 猫, escrita como ejercicio de pensar en interfaces y no en idiomas— [H]. De manera reveladora, el ejemplo desarrollado que el propio diario usa de un «idioma» por explicar es el esquema LanguageCreate del código de Lingua Mundi —prueba de que a mediados de julio los dos hilos (la visión de investigación y el código real) ya estaban entretejidos en su mente [H].

4.4 Agosto: del esquema al sistema en funcionamiento

Agosto de 2026 es el momento en que Lingua Mundi se convirtió en un sistema. Los registros sobrevivientes muestran una secuencia densa de decisiones, cada una dejando su huella:

  • 1–8 de agosto. El autor exploró las opciones de grafos y de

representación del conocimiento ("JSON as a Graph", 29 de julio; ideas de monetización de la API, 7–12 de agosto) y —de manera crítica para la arquitectura final— preguntó si la API «de verdad necesita» una pila pesada (sección 4.5) [H].

  • 11 de agosto. Exploró integrar las lenguas mayas en Lingua Mundi

("Lingua Mundi Maya integration"), continuando el interés por las lenguas indígenas de México expresado por primera vez en el mensaje de diciembre de 2025 [H].

  • 13 de agosto. Dos conversaciones de diseño definieron la forma del

producto: "Linguistic API Tech Stack" (véase 4.5) y "Semantic Interaction Layer", que esbozó la futura interfaz entre la capa de conocimiento y las aplicaciones [H].

  • 19–25 de agosto. Construyó la demostración japonesa: una base de

datos compacta sin conexión (SQLite) que empaqueta datos de diccionarios de japonés para que el diseño orientado a conceptos pudiera tocarse, consultarse y mostrarse a otros ("Build Japanese Demo"; los archivos lingua-mundi-jpn.sqlite resultantes se conservan en disco) [H]. El sprint tenía una fecha límite y una audiencia concretas: representantes de la Japan Foundation llegarían a su universidad la semana siguiente, y la demostración (junto con el editor de furigana que en el mismo periodo se estaba renombrando como Shikibu) se preparó como un dossier de producto para dejar en esa visita [H] (registro de conversación, 19–25 de agosto de 2026).

  • 23 de agosto. Al pedir una descripción de una sola frase del concepto,

recibió un resumen que coincide con lo que los registros muestran que construía: «una infraestructura lingüística legible por máquina para los idiomas humanos… en lugar de ser solo un diccionario de japonés o una aplicación de traducción, Lingua Mundi pretende convertirse en una capa general de inteligencia lingüística» [H] — y, en la misma conversación, una descripción técnica que nombraba la pila entonces planeada (PostgreSQL, Apache AGE para consultas de grafos, OpenSearch para recuperación, FastAPI como API), que las mediciones del mes siguiente volverían innecesaria (sección 4.5, sección 6) [H].

  • Del 24 de agosto en adelante. El código se mudó a su hogar permanente

como repositorio formal ("LinguaMundi"), con el rastro diario de instantáneas de respaldo en GitHub comenzando el 27 de agosto [H] (instantáneas del repositorio; véase el Apéndice A).

4.5 La decisión de la pila ligera que lo moldeó todo

La decisión técnica más trascendente de agosto está conservada textualmente. El 13 de agosto de 2026, el autor pegó su propia pila tecnológica planeada —FastAPI, Polars, DuckDB, PostgreSQL, Apache AGE (una extensión de grafos), OpenSearch, Redis, Celery, React y Docker— y preguntó: «¿De verdad necesita la API lingüística esta pila si ya corre sobre postgres?» [H] (conversación "Linguistic API Tech Stack", 13 de agosto de 2026).

La respuesta que recibió —y adoptó— fue que casi nada de eso se necesitaba todavía: PostgreSQL por sí solo podía servir datos relacionales de diccionario, kanji, lecturas, conjugaciones, traducciones, búsqueda de texto completo e incluso consultas recursivas de estilo grafo, y la regla correcta era «limitación de PostgreSQL → añadir tecnología», no «la fase 3 dice base de datos de grafos → instalar base de datos de grafos» [H] (misma conversación). El consejo concluía: «La ventaja competitiva de tu API no es la infraestructura: es el modelo de datos lingüísticos y las transformaciones que has construido sobre los datos» [H].

Esta decisión —una base de datos relacional, un marco de API y nada más hasta que la necesidad se mida— es el ancestro directo de la arquitectura de rendimiento descrita en las secciones 6–7. Cuando, en septiembre de 2026, la base de datos creció a 1.6 millones de sentidos de palabra y las consultas ingenuas se volvieron tan lentas que tomaban minutos, el autor no recurrió a una base de datos de grafos ni a un motor de búsqueda: recurrió a las vistas materializadas de PostgreSQL —el patrón de «hornear, no volver a derivar»— y redujo las consultas más lentas de más de un minuto a aproximadamente un segundo en hardware de 2014 (sección 7). La decisión de agosto de mantenerse ligero es lo que hizo esa optimización de septiembre a la vez necesaria y posible.

4.6 El método de desarrollo humano-IA, en la práctica

Quien lea esta historia habrá notado que casi todo hito va acompañado de un registro de conversación: el autor piensa en diálogo. Para agosto de 2026 su método se había estabilizado en algo que puede describirse con precisión a partir del registro:

  1. El humano fija la dirección y es dueño de los datos. Cada solicitud en

los registros es del propio autor; cada archivo está en su máquina; cada decisión —incluidas las marchas atrás, como la pregunta de la pila ligera— es suya.

  1. Los modelos de IA se usan como colaboradores especializados. ChatGPT se

usó intensamente para investigación, crítica de arquitectura y auditoría; DeepSeek, para ciclos de redacción y revisión y (más tarde) como el arnés (harness) que sustenta la automatización propia del estudio; Claude, para memoria de largo plazo y contexto de proyecto (la base de conocimiento del estudio comenzó como una exportación de memoria de Claude).

  1. El registro se conserva. Las conversaciones se exportan (los archivos

del autor contienen miles), el código se fotografía en instantáneas y —desde el 26 de agosto de 2026— cada sesión de trabajo se registra en una base de conocimiento de Obsidian con frontmatter, fechas y estado de verificación (sección 9). Este artículo solo es posible gracias a ese hábito de llevar registro.

  1. La revisión adversarial está incorporada. El ciclo de auditoría V1–V7

del manuscrito de junio (sección 3.3) se convirtió en una práctica permanente: los borradores los audita un modelo distinto del que los escribió, y las auditorías se conservan en archivo.

Se llame a esto «vibe coding», «desarrollo asistido por IA» o simplemente «usar las herramientas», la etiqueta honesta importa para el registro: Lingua Mundi es un proyecto de autoría humana construido en colaboración deliberada y documentada con asistentes de IA, y este artículo (él mismo un borrador generado por IA bajo la dirección del autor, según el aviso inicial) es un artefacto del mismo método.

5 · Diseño: los principios lingüísticos y matemáticos del modelo

Esta sección explica, en lenguaje sencillo, las ideas que determinan cómo Lingua Mundi almacena el idioma. Los lectores que quieran la historia pueden saltar a la sección 6; los que quieran las fórmulas y el esquema las encontrarán aquí y en el Apéndice A.

5.1 Cuatro tipos de objetos, un espacio de significados

El modelo de datos desciende directamente de los cuatro tipos de entidad del canal de importación de diciembre de 2025 (sección 1.2) y de las once tablas de la especificación de julio de 2026 [H]. En su forma madura almacena cinco tipos centrales de cosas (verificados contra el esquema en vivo, septiembre de 2026 [H]):

  • Idioma — una fila por idioma humano, con su código de tres letras ISO

639-3 como clave (eng, spa, jpn, …), con su nombre, su autónimo (el nombre que usan sus hablantes), su familia lingüística y su escritura. Añadir un idioma a todo el sistema es, por diseño, añadir una fila más conjuntos de datos: no hay tablas por idioma en ningún lado [H] (código y nota de proyecto, 29 de agosto de 2026). Esta propiedad de ser «independiente del idioma» es la expresión a nivel de esquema de la idea de la interlingua (sección 2.1).

  • Lexema — una forma de palabra en un idioma específico: la cadena cat,

la cadena gato, la cadena . Un lexema pertenece exactamente a un idioma y lleva una categoría gramatical.

  • Sentido — *un significado de un lexema tal como lo registra un

diccionario: el sentido de "cat" animal, de WordNet; el sentido de "cat" músico de jazz, de WordNet; el sentido de "cat" tronco de yule, de Wiktionary. Un lexema suele tener muchos sentidos: así representa el modelo la polisemia* (una palabra, muchos significados) sin colapsar nunca los significados entre sí. Un sentido puede estar o no vinculado todavía a un concepto; el vínculo es el campo concept_id, que puede ser NULL por diseño —un sentido sin vincular se conserva y se muestra como un sentido huérfano en lugar de ser colocado en su sitio por una conjetura— [H] (esquema; notas del canal de importación, diciembre de 2025).

  • Concepto — un significado compartido entre idiomas: el concepto «gato

doméstico» identificado por el URI de synset de Princeton WordNet princeton-wordnet:02121620-n [H] (base de datos en vivo). Los conceptos son donde ocurre la alineación multilingüe: el gato español (uno de sus sentidos), el cat inglés, el chat francés, el Katze alemán y el japonés pueden apuntar todos al mismo concepto —son «una estrella» con muchos nombres— (sección 8). La tabla de conceptos es el corazón del sistema y, en la base de datos actual, contiene 96,434 filas [H] (medición, 6–7 de septiembre de 2026).

  • Relación — una conexión tipada y dirigida entre dos conceptos, p. ej.,

gato doméstico IS_A felino, o felino IS_A carnívoro. Las relaciones llevan un predicado, una confianza y una fuente. La base de datos actual contiene 171,672 de ellas [H] (medición, 6–7 de septiembre de 2026).

Alrededor de estos cinco se asienta la maquinaria de procedencia —una tabla source que registra de dónde vino cada conjunto de datos, su licencia y su URL (para que ninguna afirmación de la base de datos quede nunca sin atribución), tablas de synsets que hacen de puente con el formato del OMW y tablas de apoyo para kanji y lecturas— [H] (esquema, septiembre de 2026).

5.2 El problema de la alineación, y por qué no se finge

El problema intelectual central de un mapa multilingüe de significados es la alineación: decidir que este sentido de esta palabra en este idioma es el mismo significado que aquel sentido de aquella palabra en aquel idioma. La respuesta de Lingua Mundi, heredada del diseño del OMW, es no decidirlo desde cero: el OMW ya declara, por idioma, cuáles de sus synsets corresponden a synsets de Princeton WordNet; la base de datos importa, pues, esos mapeos explícitos como su capa de alineación primaria [H] (Bond & Foster, 2013; código de importación). Donde no existe un mapeo explícito, el sistema aplica su jerarquía de confianza de cinco niveles (de la especificación de julio de 2026): los vínculos explícitos declarados por la fuente ocupan el rango más alto; los vínculos inferidos ocupan el más bajo y se almacenan con su nivel —nunca se promueven en silencio a «hecho»— [H] (especificación, 24 de julio de 2026). Esta es la forma madura de la regla de diciembre que el autor garabateó en su código del canal de importación: «cero heurísticas». No es que el sistema nunca conjeture; es que las conjeturas se etiquetan como conjeturas, y eso es lo que hace a la base de datos suficientemente honesta para crecer: una conjetura equivocada marcada como conjetura puede encontrarse y corregirse; una conjetura equivocada almacenada como hecho envenena todo lo que hay río abajo.

La misma filosofía gobierna la granularidad de los idiomas. La ISO 639-3 distingue idiomas reales, no fronteras políticas ni variantes de sistema de escritura. El autor ha señalado un caso genuinamente difícil para el futuro: el coreano, cuyo único código ISO kor cubre tanto el estándar de la República de Corea como el de la República Popular Democrática de Corea. Los registros sobrevivientes muestran que esto quedó señalado como una decisión de modelado abierta [H] (registro de sesión, 7 de septiembre de 2026) —un ejemplo del principio del esquema de que almacena idiomas, no variantes locales, y un recordatorio de que los datos de idiomas del mundo real se resisten a cajas prolijas de una fila por idioma.

5.3 El grafo: taxonomías, vecindarios y la cola larga

Una vez que los sentidos se alinean con los conceptos y las relaciones conectan conceptos, la base de datos es un grafo: 96,434 nodos-significado unidos por 171,672 aristas tipadas, cuyo componente más grande es la taxonomía es-un heredada de WordNet (mamífero → carnívoro → felino → gato doméstico), enriquecida con relaciones de instancia-de, parte-de y entre idiomas [H] (medición, septiembre de 2026; esquema). Tres hechos matemáticos sobre esos grafos dan forma a la interfaz de usuario y a la ingeniería:

  1. Las taxonomías son árboles de significado. Como se conocen los padres

de cada concepto, el sistema puede responder «¿de qué es esto un tipo?» (subir) y «¿cuáles son los tipos de esto?» (bajar) —las operaciones detrás del lente de taxonomía de la interfaz (sección 8)—.

  1. Las distribuciones de grado son zipfianas. Los grafos lingüísticos

reales son más o menos libres de escala: unos pocos conceptos (como «animal», «persona», «cosa») tienen vecindarios enormes, mientras que la mayoría tiene un puñado de vecinos. Esta «cola larga» es la misma forma estadística que Zipf midió famosamente en las frecuencias de palabras (Zipf, 1949): un pequeño número de palabras explica la mayor parte del uso. De aquí se siguen dos consecuencias de diseño: la clasificación debe existir (no se pueden mostrar 30,000 significados para una consulta) y debe ser significativa —la interfaz clasifica, por tanto, los conceptos por su brillo en el cielo, un indicador aproximado de lo «importante» o bien conectado que es un significado (sección 5.5)—.

  1. Los caminos más cortos son la ruta de traducción natural. Dados dos

conceptos, el grafo puede buscarse en busca de un camino que los conecte —la operación detrás de la herramienta del sextante de la interfaz (sección 8.4), implementada como una búsqueda bidireccional en amplitud acotada sobre la taxonomía (≤ 10 saltos, 25 vecinos por nodo, respuesta en milisegundos)— [H] (código, medición en vivo, septiembre de 2026).

5.4 Zipf y la forma de los diccionarios

Schematic Zipfian long tail: the head is baked, the tail stays relationalthe headfew words, most usage —baked into ranking viewsthe long tailrare words stay in therelational tablesschematic — Zipf's law: frequency ∝ 1/rank (Zipf, 1949)
Schematic only — it illustrates the design consequence of Zipf's law described in Section 5.4.

La ley de Zipf merece una mención explícita porque explica silenciosamente toda la arquitectura de rendimiento. Si las frecuencias de las palabras siguen una ley de potencias, entonces todo diccionario está dominado por una cabeza corta de palabras comunes y una cola astronómicamente larga de palabras raras. El manuscrito de junio de 2026 incluso derivó un cálculo de cobertura basado en Zipf para los vocabularios de conceptos [H] (auditoría del manuscrito V7, 1 de junio de 2026). Para la base de datos, la cola larga significa: la mayoría de las filas son palabras raras, la mayoría de las consultas golpean palabras comunes, y cualquier consulta que deba escanear toda la tabla —incluidas todas las palabras raras— es catastróficamente más lenta que una consulta que pueda partir de una clasificación precomputada. El patrón de vista materializada de la sección 7 es, en el fondo, una forma de convertir la ley de Zipf de enemigo del rendimiento en herramienta de diseño: hornear la cabeza (la clasificación, las palabras principales por concepto) una sola vez, y dejar que la cola permanezca en las tablas relacionales para las búsquedas raras que de verdad la necesitan.

5.5 El brillo en el cielo: una clasificación para gobernar el mapa

La metáfora organizadora de la interfaz es un mapa estelar (sección 8), y la metáfora está respaldada por un cálculo real. A cada concepto se le asigna un brillo —una magnitud numérica usada para ordenar el cielo— derivado de cómo se sitúa en el grafo multilingüe: cuántos idiomas tienen palabras adosadas, cuán ricos son esos conjuntos de palabras y cuán prominente es el concepto en la taxonomía. La base de datos materializa esto como concept_sky_rank, un ordenamiento precomputado de los 96,000+ conceptos, de modo que «dame el cielo» nunca exija ordenar un millón de filas en el momento de la consulta [H] (scripts y medición, 6 de septiembre de 2026). Dos vistas complementarias —concept_lang_rank (clasificaciones por idioma) y concept_word_rank (las cuatro palabras principales por concepto y por idioma, «horneadas» para que enriquecer una estrella con sus palabras sea una búsqueda y no una unión sobre 1.6 millones de sentidos)— completan el sistema de clasificación [H] (scripts, 6 de septiembre de 2026; conteos de filas en el Apéndice A).

5.6 Trabajo acotado: la disciplina del diseñador de videojuegos aplicada a una base de datos

El último principio de diseño está tomado de los videojuegos. Un juego renderiza un cuadro en 16 milisegundos sin importar lo grande que sea el mundo: presupuesta el trabajo por cuadro. Lingua Mundi aplica la misma disciplina —trabajo acotado por consulta sobre un espacio de datos no acotado— porque su hardware lo exige (una computadora portátil de la era 2014; sección 9). Ninguna solicitud puede escanear todo el corpus; toda solicitud debe partir de un índice o de una vista horneada; la interfaz solo debe renderizar cuando el usuario hace algo (CPU ociosa ≈ 0%); y los resultados se paginan con ventanas estables. Las secciones 6 y 7 muestran los tres muros de rendimiento contra los que chocó esta disciplina y cómo se resolvió cada uno con el mismo patrón: hornear, no volver a derivar.

6 · Arquitectura: importar el mundo, servir el mapa

6.1 El canal de importación: un registro, más de veinte importadores

Todo conjunto de datos entra en Lingua Mundi a través de un importador —un programa que sabe leer un formato externo y escribirlo en el esquema canónico—. La lista única y autoritativa de importadores vive en un solo archivo, el registro de importadores; para septiembre de 2026 contenía más de veinte plugins registrados que cubren: Princeton WordNet y el WordNet inglés, el Open Multilingual Wordnet (OMW), Wiktionary y su derivado legible por máquina kaikki, Wikidata, UniMorph y J-UniMorph (morfología), los treebanks de Universal Dependencies (UD), OpenThesaurus (sinónimos del alemán), el diccionario de pronunciación CMU, las descomposiciones de caracteres IDS, los datos translingüísticos de CLICS, las listas de frecuencia de palabras y la familia japonesa —JMdict, EJDict, KANJIDIC2— [H] (registro de importadores y notas de proyecto, consultados el 6–7 de septiembre de 2026). (Una salvedad por precisión: existe una carpeta para corpus paralelos de OPUS en el directorio de importadores, pero es un stub vacío y no registrado que espera la capa de oraciones de la hoja de ruta; se lista aquí por honestidad, no como una fuente publicada [H] (inventario de código, 6–7 de septiembre de 2026)). Cada importador registra sus idiomas objetivo contra los mismos códigos ISO, y eso es lo que mantiene el esquema independiente del idioma en la práctica, y no solo en la teoría [H] (código).

Las importaciones son supervisadas por un canal de importación que ejecuta cada fuente, registra el trabajo de importación y —algo crucial para la sección 7— informa del éxito. Tras cada importación refresca las vistas de clasificación (sección 5.5) para que el «cielo» refleje siempre los datos más frescos [H] (scripts, septiembre de 2026).

6.2 El corpus hoy (medido)

Lexemes per live language (rounded, September 2026 audit)Japanese · jpn345k lexemesEnglish · eng271k lexemesGerman · deu176k lexemesSpanish · spa152k lexemesFrench · fra149k lexemesPortuguese · por145k lexemeslexemes in thousands (enrichment audit, rounded — Section 6.2)
Lexemes per live language (enrichment audit, 6 September 2026; rounded). Full SQL counts in Section 6.2.

Medición SQL directa de la base de datos en vivo el 6 de septiembre de 2026 a las 23:02 hora central, re-verificada el 7 de septiembre de 2026 (ambos conteos idénticos) [H]:

TablaFilas
conceptos (significados)96,434
lexemas (formas de palabra)1,238,383
sentidos (significados por palabra y diccionario)1,608,018
relaciones (vínculos tipados entre conceptos)171,672
idiomas (en vivo)6 — eng, spa, fra, deu, por, jpn

Peso léxico por idioma (auditoría de enriquecimiento, 6 de septiembre de 2026 [H]):

IdiomaLexemasSentidos
Japonés (jpn)≈ 345,000≈ 528,000
Inglés (eng)≈ 271,000≈ 393,000
Alemán (deu)≈ 176,000≈ 203,000
Español (spa)≈ 152,000≈ 167,000
Francés (fra)≈ 149,000≈ 157,000
Portugués (por)≈ 145,000≈ 160,000

Dos salvedades honestas acompañan a estas cifras. Primera: las cifras por idioma son aproximadas (redondeadas de la auditoría); los conteos SQL a nivel de tabla son exactos en el instante de su medición. Segunda: el corpus está en capas: algunos conjuntos de datos (kaikki Wiktionary y las listas de frecuencia de palabras) se limitaron deliberadamente a 50,000 filas por ejecución de importación, con cobertura más profunda provista por otras fuentes, y ese límite está documentado en lugar de oculto [H] (auditoría, 6 de septiembre de 2026). La sección 7 muestra lo que ocurre cuando un límite similar no se documenta como riesgo.

6.3 La superficie de la API

El sistema expone una API HTTP pequeña y deliberadamente congelada (FastAPI), cuya superficie de la Fase 0 está documentada como algo que nunca se rompe al llegar nuevas fases [H] (nota de proyecto, 29 de agosto de 2026). Los endpoints, verificados en vivo en septiembre de 2026 [H]:

  • /languages — lista los idiomas en vivo y sus metadatos;
  • /lexemes y /concepts — consultas de listado paginadas (limit/offset, con

tope de 1,000 por página después de que una auditoría de agosto–septiembre las encontrara sin límite);

  • /analyze — análisis morfológico/léxico de una palabra;
  • /kanji y /lookup — las consultas japonesas de kanji y de diccionario;
  • /graph/sky — el feed del mapa estelar: conceptos clasificados por brillo

en el cielo, con parámetros para la búsqueda (query, lang), la profundidad (skip/tier), si se adjuntan las palabras miembros (words) y un lente de taxonomía (anchor, lens=up|down) que sube o baja por el árbol es-un desde un concepto dado;

  • /graph/star/{id} — una estrella completa: sus palabras miembros por idioma

y sus conceptos vecinos, ambos paginados;

  • /graph/path — la búsqueda acotada en el grafo (sección 5.3) entre dos

conceptos;

  • /graph/word — el «lente de palabra»: dada una palabra y un idioma, los

conceptos a los que se vinculan actualmente sus sentidos.

Todas las respuestas van comprimidas (gzip), y toda consulta está diseñada para ejecutarse desde un índice o una vista materializada —la regla de «trabajo acotado» de la sección 5.6— [H] (código y encabezados en vivo, septiembre de 2026).

6.4 Por qué el diseño es independiente del idioma en la base de datos, y no solo sobre el papel

El lector puede ver ya el ciclo completo. Un idioma nuevo llega como una fila language (digamos, mandarín, código cmn) más los conjuntos de datos registrados (el wordnet de mandarín del OMW, un treebank de mandarín de UD). Los importadores escriben sus lexemas, sus sentidos y —donde existen el OMW u otros mapeos explícitos— sus vínculos sentido→concepto. Las vistas de clasificación se recalculan; el cielo gana un idioma nuevo; ninguna tabla cambia; ninguna migración; ningún caso especial en la API. La siguiente familia planeada a lo largo de esta misma vía —mandarín, cantonés, coreano y vietnamita— se describe en la sección 10.3, donde se registra el reconocimiento de disponibilidad de datos que decidirá su calendario [H] (registro de sesión, 7 de septiembre de 2026). La promesa del diseño —«añadir idiomas indefinidamente»— no es, pues, marketing: es la consecuencia directa del esquema.

7 · Dos lecciones de infraestructura: «hornear, no volver a derivar» y «fallar ruidosamente»

Query latency before and after the materialized-view patterndefault sky8.6s0.25ssky · 1,000 stars + words>60s1.1sper-request ranking0.5s0.02s
Query latency before and after the "bake, don't re-derive" materialized views (warm cache; 2014-era laptop).

Todo proyecto de base de datos acaba topándose con sus muros de rendimiento. Lingua Mundi se topó con tres en una sola semana —y entonces descubrió que el problema más interesante no era la velocidad, sino el silencio—. Esta sección cuenta ambas historias porque, juntas, son las lecciones de ingeniería más transferibles del proyecto.

7.1 El patrón: hornear, no volver a derivar

La regla que resolvió los tres muros de rendimiento es bastante simple como para enunciarla en una frase: cuando muchas consultas necesitan el mismo cálculo costoso, calcúlese una vez, guárdese el resultado y manténgase fresco —no se recalcule para cada consulta—. En términos de base de datos, Lingua Mundi usa vistas materializadas de PostgreSQL: tablas precomputadas que actúan como índices llenos de respuestas.

  • Muro 1 — clasificar el cielo. Originalmente, pedir el mapa estelar por

defecto obligaba a la base de datos a reclasificar todo el corpus por solicitud: unos 8.6 segundos cada vez en la computadora portátil de la era 2014 del proyecto. El arreglo horneó la clasificación en concept_sky_rank y concept_lang_rank (94,498 y 218,120 filas precomputadas), tras lo cual el cielo por defecto respondía en ~0.25 s y las solicitudes más profundas en decenas de milisegundos [H] (medido, 6 de septiembre de 2026).

  • Muro 2 — nombrar las estrellas. Pedir el cielo con sus palabras

adosadas (las palabras principales por concepto y por idioma) exigía una unión a través de 1.6 millones de sentidos en cada solicitud; con 1,000 estrellas, la consulta tomaba más de un minuto —un caso patológico—. El arreglo horneó las propias palabras: concept_word_rank precomputa las cuatro palabras principales por concepto y por idioma (338,378 filas en su creación), convirtiendo una unión de más de un minuto en una búsqueda de ~1.1 s y la vista por defecto en ~0.25 s [H] (medido, 6 de septiembre de 2026).

  • Muro 3 — jerarquía y paginación. Subir y bajar por la taxonomía (lente

arriba/abajo) y paginar ventanas estables de estrellas se resolvieron con predicados canónicos, ordenación por índice y ventanas de paginación estables (consultas de estilo DISTINCT ON), en lugar de con una base de datos de grafos —el fruto de la decisión de agosto de la «pila ligera» (sección 4.5)— [H] (código y mediciones, 6 de septiembre de 2026).

Tras cada importación las vistas se refrescan automáticamente, de modo que «horneado» nunca significa «rancio» [H] (scripts). Todo el patrón es una instancia nativa de base de datos de lo que los desarrolladores de videojuegos llaman presupuestar: el trabajo costoso ocurre una sola vez, fuera del camino crítico, y la solicitud del usuario solo lee respuestas precomputadas.

7.2 El truncamiento silencioso que ocultó a cat

A finales de agosto de 2026, la capa inglesa del corpus se importó con un tope de filas que nadie pretendía que fuera un tope. El script de importación supervisor limitó la importación del Open Multilingual Wordnet en inglés a 50,000 candidatos —y después informó éxito— [H] (registro de sesión, 6 de septiembre de 2026, entrada de causa raíz). El cat inglés es el candidato número 52,195 en el orden alfabético del archivo. Fue cortado. Aproximadamente 21,830 de los 117,659 synsets ingleses nunca se crearon; para esos significados, los sentidos ingleses existían como entradas de diccionario en bruto, pero nunca se vincularon a conceptos. La palabra cat no faltaba de la base de datos: era invisible para el mapa: una búsqueda de su significado no podía encontrarla, porque el nodo-significado al que debían apuntar sus sentidos nunca se había construido [H] (misma fuente).

Durante unos seis días, nadie lo supo. La demostración que al autor le importaba —cat · gato · 猫 en una estrella— funcionaba en español y en japonés, pero salía vacía en inglés, y el resultado vacío parecía una laguna de datos —como si el inglés careciera de la palabra—. (Una nota de tiempos del registro: el propio cielo multilingüe solo llegó cuando integrate_core6.py terminó de vincular los idiomas importados cerca del final de la corrida de importación de agosto–septiembre —antes, el cielo de respaldo era una pequeña vista de un solo idioma—, por lo que el hueco del inglés solo afloró a principios de septiembre, una vez que la vista de conceptos compartidos estuvo realmente en vivo [H] (registro de sesión, 6 de septiembre de 2026)). La insistencia del propio autor, registrada en el registro de sesión, era que esto era «no una laguna de datos: infraestructura» [H] (registro de sesión, 6 de septiembre de 2026). Tenía razón. El fallo no estaba en los datos, sino en la honestidad del canal de importación: una importación truncada había informado éxito, y nada en el sistema estaba diseñado para notar que ese «éxito», con un tope de 50,000 filas, significaba un fracaso para el candidato 52,195.

7.3 El arreglo: una cadena de reparación sin tope e idempotente

La reparación —diseñada y lanzada el 6–7 de septiembre de 2026 y verificada como completa el 8 de septiembre de 2026 (véase la sección 10.1)— es un modelo de cómo arreglar un canal de datos sin perder datos ni confianza [H] (scripts y registro de sesión, 6–7 de septiembre de 2026):

  1. re-importar el WordNet inglés sin el tope —de forma idempotente, para

que una corrida interrumpida pueda simplemente relanzarse sin duplicar filas;

  1. volver a ejecutar las relaciones entre synsets para los synsets recién

creados;

  1. integrar: promover los synsets nuevos a conceptos, vincular los campos

concept_id de los sentidos miembros y re-expresar las relaciones de conceptos;

  1. refrescar las vistas materializadas para que el mapa refleje el corpus

reparado; y

  1. verificar de extremo a extremo con un script de aceptación que

demuestre, desde la base de datos y a través de la API en vivo, que el cat inglés alcanza el concepto gato doméstico princeton-wordnet:02121620-n junto con sus miembros multilingües —gato, chat, Katze, — y que el concepto tiene padres en la taxonomía. La verificación de aceptación está diseñada para poder re-ejecutarse en cualquier momento y para terminar con un PASS o FAIL rotundo.

Como cada paso se escribió para ser idempotente (get-or-create, skip-if-exists), un choque de la máquina a mitad de la reparación solo cuesta tiempo: la cadena puede relanzarse y terminará el trabajo. La misma propiedad protege a la base de datos en vivo de los estados parciales.

7.4 La lección: fallar ruidosamente frente a fallar en silencio

El episodio de cat es un caso de manual de un problema que todo ingeniero de datos teme: un canal de importación que falla en silencio e informa éxito. La lección metodológica —que un tope de filas no es un criterio de éxito y que los importadores deben verificar la completitud, no solo la finalización— merece enunciarse como principio general para la infraestructura de datos abiertos, donde los conjuntos de datos llegan sin garantías y los canales de importación se ensamblan a mano. La respuesta de Lingua Mundi se institucionalizó en dos formas: el script de aceptación que cualquier futura cadena de importación puede ejecutar, y la regla permanente del estudio de que las afirmaciones no verificadas se etiquetan como no verificadas —en la base de datos (sentidos huérfanos mantenidos a la vista, niveles de confianza en los vínculos) y en todo registro escrito (la convención [H]/[O]/[NV] de este artículo, Apéndice A)—. Un sistema que puede mostrar sus huérfanos es un sistema cuyos huecos pueden encontrarse. Un sistema que los oculta es un sistema cuyos huecos se encontrarán —tarde o temprano, por la peor persona posible: un usuario que busca cat.

8 · La interfaz: un mapa estelar de significados

Los datos solos no son un producto. La pregunta que dio forma a la interfaz de Lingua Mundi era simple: ¿cómo debería sentirse mirar un mapa de significados? La respuesta del autor, desarrollada durante la primera semana de septiembre de 2026, fue que debería sentirse como mirar un cielo —y, en concreto, como la carta de un planeta del tesoro ficticio: un mapa de papel navegable de un universo donde cada estrella es una idea, y los idiomas son los telescopios que uno elige para verla a través de ellos— [H] (registros de sesión, 1–7 de septiembre de 2026). Esta sección describe la interfaz resultante: su metáfora pedagógica, su lenguaje visual, sus instrumentos y la disciplina de ingeniería que permite que todo ello funcione en una computadora portátil de 2014.

8.1 De la página de diccionario al cielo: nombrar el producto

La interfaz pasó por tres identidades en dos semanas, y los nombres siguen la evolución del producto [H] (registros de sesión, 31 de agosto – 6 de septiembre de 2026). Comenzó como una página de diccionario ordinaria ("/gui/", llamada el Observatorio el 31 de agosto), se convirtió en el Planetario el 1 de septiembre, cuando terminaron las importaciones de datos y apareció una visualización de campo estelar, y —después de que el autor mirara el resultado y declarara que las estrellas eran «andamiaje, no el producto»— giró, la noche del 6 de septiembre, hacia un explorador de grafo semántico: el mismo cielo, pero ahora el punto era el significado, con nodos que son conceptos etiquetados en los idiomas que uno habilita, aristas coloreadas por familia de relaciones y una búsqueda que desambigua sentidos. La vista de cielo anterior se conservó, pero sin enlazar; el explorador se convirtió en la cara por defecto de Lingua Mundi [H] (registro de sesión, 6 de septiembre de 2026).

8.2 La metáfora pedagógica: un instrumento, no un tablero

Cada elemento de la interfaz se corresponde uno a uno con un concepto de la astronomía y del propio proyecto lingüístico —un diseño pedagógico deliberado (la tabla de metáforas es la documentación interna del producto)— [H] (registros de sesión, 6–7 de septiembre de 2026):

Elemento del mapa estelarQué es en realidad
Una estrellaUn concepto — un significado compartido entre idiomas
El brillo de las estrellas (magnitud)La riqueza léxica y la conectividad de un concepto (sección 5.5)
El idioma a través del cual mirasUn telescopio — el mismo cielo visto en español, inglés, japonés…
Constelaciones e hilosFamilias de relaciones — la taxonomía es-un dibujada como líneas de rumbo trazadas
AcercarseDescender del cielo amplio a una sola estrella y su vecindario (la idea Hipparcos→Gaia — Gaia Collaboration et al. (2018): más detalle cuanto más profundo se desciende)
El dial de exposiciónProfundizar el campo — pedir más estrellas, y más tenues, alrededor de un foco
El sextanteMedir una ruta entre dos significados a través de la taxonomía
Marcas del cieloMarcadores sobre estrellas
La brújula de palabrasLos idiomas habilitados, rodeando la estrella enfocada como fichas de palabras
El cuaderno de bitácoraTu rastro de exploración — cómo llegaste a este significado

Nada de esto es decoración; el encargo de diseño (design brief) que el autor escribió para la herramienta está citado en los registros y merece repetirse: la interfaz debe ser «una herramienta real de descubrimiento, no un juguete» —un mapa de todos los idiomas que un estudiante o un investigador pueda explorar de verdad— y sus fuentes deben comportarse como un mapa de papel navegable, no como un tablero [H] (registros de sesión, 6 de septiembre de 2026). En el mismo espíritu, los paneles de instrumentos son deliberadamente esqueuomórficos: diales de exposición con perillas de latón, mediciones de sextante, derroteros trazados, un sello de época —la estética de un viejo observatorio, elegida para enseñar por la sensación y no por las etiquetas de menú—.

8.3 Qué hay en pantalla

El explorador, verificado de extremo a extremo en septiembre de 2026 [H], ofrece:

  • Búsqueda con desambiguación de sentidos. Escribir gato (español)

devuelve estrellas-significado; cada resultado puede mostrar qué palabras, en qué idiomas, comparten el significado —el panel de la estrella gato doméstico muestra sus miembros del synset multilingüe, p. ej., el cat y grimalkin ingleses, el Katze alemán, el japonés (sección 8.5)—.

  • Viaje. Haga clic en una estrella (o clic con mayúsculas / pulse la tecla

de medir) para convertirla en el foco; el cielo se recentra en ella y aparece su vecindario.

  • El panel de la estrella. Los miembros por idioma de la estrella

enfocada, su definición y sus vecinos —con paginación para los vecindarios grandes—.

  • El lente de taxonomía. Subir a los padres de una estrella («¿de qué es

esto un tipo?») o bajar a sus hijos («¿qué tipos de esto existen?») por los predicados canónicos de la familia es-un.

  • Los instrumentos (todos en vivo, verificados): el dial de exposición

amplía el campo de la estrella enfocada por pasos (90 → 180 → 360 → 720 → 1,000 estrellas), fundiendo el cielo más amplio sin volver a viajar; el sextante mide un camino acotado en el grafo entre dos estrellas (la búsqueda /graph/path de la sección 5.3), trazando un derrotero dorado discontinuo a través del cielo y registrando cada tramo; las marcas del cielo fijan estrellas (persistidas localmente, para que tu propia mini-constelación sobreviva a las recargas); la brújula de palabras rodea la estrella enfocada con fichas de palabras —una por idioma habilitado, clicables para cambiar el idioma de búsqueda—; y el cuaderno de bitácora, la marcación de regreso, el sello de época y la retícula te mantienen orientado [H] (registro de sesión, 7 de septiembre de 2026).

  • El acceso de apoyo. Un control «✦ support» abre el modal de donaciones

(sección 10).

8.4 Ingeniería del cielo en hardware de 2014

La belleza de la interfaz está subordinada a una restricción dura: debe funcionar con fluidez en una máquina con un procesador de la era 2014, 8 GB de RAM y un disco giratorio —la misma máquina que aloja la base de datos—. La ingeniería que lo hace posible merece documentarse porque es la misma disciplina de trabajo acotado de la sección 7, aplicada a los píxeles [H] (registros de auditoría y de sesión, 6–7 de septiembre de 2026):

  • La página solo renderiza ante la entrada del usuario. El uso de CPU en

reposo es ~0%; nada se anima a menos que el usuario haga algo. No hay animación perpetua —una elección deliberada bajo el «presupuesto de la papa» (sección 9)—.

  • La nebulosa está horneada. El fondo decorativo (flores y polvo en

púrpura/verde azulado/rosa) se pinta una vez por cada cambio de tamaño y luego se guarda en caché, con paralaje de cámara al redibujar, en lugar de recalcularse por cuadro.

  • Las etiquetas se racionan. Solo se dibujan ~24 etiquetas de estrellas

por cuadro —un presupuesto de etiquetas—, lo que mantiene los redibujos baratos y el texto legible [H] (el código de la interfaz acota las ubicaciones con MAX_LABELS = 24; gui/planetarium-v1.html).

  • Las solicitudes están protegidas. Tokens de respuesta obsoleta y

controles de cancelación anulan las consultas en vuelo cuando el usuario sigue adelante; los dobles clics difieren las acciones de un solo clic para que no se dispare ninguna búsqueda desperdiciada; los redimensionamientos se retardan (debounce) y la relación de píxeles del canvas tiene tope (reduciendo la memoria de un cambio de tamaño de ~24 MB a ~11 MB en 1080p).

  • La accesibilidad es explícita: los roles del canvas y las etiquetas

aria, el soporte de movimiento reducido y el desplazamiento por teclado se añadieron en la misma pasada que el pulido visual [H] (registro de sesión, 7 de septiembre de 2026).

8.5 La demostración que lo ata todo

La demostración permanente del proyecto es la palabra cat —o, mejor dicho, el concepto al que pertenece—. Busque gato en español en el explorador, viaje hasta la estrella y el panel mostrará el synset princeton-wordnet:02121620-n con sus miembros en los idiomas en vivo. El subconjunto realmente verificado de extremo a extremo en las comprobaciones sin cabeza (headless) del 6–7 de septiembre de 2026 está registrado en el registro de pruebas —el cat y grimalkin ingleses y felis silvestris catus (el nombre científico que WordNet almacena), el Katze alemán, el gato español, el japonés—; y las listas de miembros más amplias que la base de datos almacena para ese synset (p. ej., el inglés housecat, mouser, puss, tomcat; el francés chat, chatte; el alemán Kater; el japonés ネコ; el portugués gato, bichano) provienen de la membresía wordnet importada, no del registro de extremo a extremo; quien quiera la enumeración actual completa puede re-ejecutar la consulta de aceptación de la sección 7.3 [H con [NV] en la cola no probada] (registro E2E sin cabeza y base de datos en vivo, 6–7 de septiembre de 2026). Una estrella, seis idiomas, un significado: la intuición de diciembre de 2025, visible en pantalla. El lado inglés de esta demostración es exactamente lo que el error de la sección 7.2 rompió por un tiempo: una búsqueda de gato impulsada por el español llegó a la estrella todo el tiempo, mientras que una búsqueda de cat impulsada por el inglés solo funciona después de la reparación de cobertura, y el script de aceptación de la sección 7.3 existe precisamente para probar, bajo demanda, que cat · gato · 猫 comparten su estrella.

9 · El banco de trabajo: herramientas, flujo de trabajo y la máquina «papa»

Una historia de proyecto está incompleta sin el banco de trabajo sobre el que se construyó. El banco de trabajo de Lingua Mundi es inusual, y las restricciones que impuso moldearon casi todas las decisiones de ingeniería de este artículo.

9.1 La papa

La máquina que aloja la base de datos, la API, la interfaz y el entorno de desarrollo es una sola computadora portátil de consumo: una ASUS X751MA con un Intel Pentium N3540 (Bay-Trail, cuatro núcleos, sin AVX2), 8 GB de RAM (7.6 GiB utilizables), un disco duro de 5400 rpm y un enlace de subida a internet de unos 47 KB/s —capturado en vivo para este artículo el 7 de septiembre de 2026 ([H], lscpu//proc/meminfo en la propia máquina)—. Las notas del proyecto describen esta misma máquina de diversas maneras: como un Atom Z36xx/Z37xx o como un Pentium N3540 —la misma familia de silicio Bay-Trail bajo nombres distintos [O]—; registros de chat anteriores de 2026 también mencionan un perfil diferente (una máquina Intel Jasper Lake "N5105"), que la sección 10.2 lista como un conflicto sin resolver en los registros de hardware. El estudio llama al equipo en vivo, con cariño, la papa —y fijó una regla que aparece a lo largo de todos los registros: una operación pesada a la vez, envoltorios con protección de memoria, nada de animación perpetua, nada de infraestructura prematura (sección 4.5) y todo trabajo pesado ejecutado como un script separado auto-avisador que informa cuando termina, en lugar de ser sondeado— [H] (registros de sesión y herramientas, septiembre de 2026). El patrón de «hornear, no volver a derivar» (sección 7), la interfaz que solo actúa ante la entrada del usuario (sección 8.4) y la superficie de investigación de costo cero de LLM (sección 9.4) son, en el fondo, consecuencias de la papa —prueba de que un presupuesto ajustado puede ser una virtud de diseño y no una limitación—.

9.2 La pila de software

El sistema en funcionamiento (verificado en vivo, septiembre de 2026 [H]): PostgreSQL 16 como único almacén de datos (sección 4.5), FastAPI (Python) como capa de API, SQLAlchemy + Alembic para modelos y migraciones, scripts de Python para los importadores y la gestión de vistas materializadas, y una pequeña interfaz web sin dependencias (HTML/CSS/JavaScript) servida desde el mismo origen. La maquinaria auxiliar incluye servicios de usuario de systemd que mantienen vivos la API y el guardián de memoria/térmico (sección 9.5), un respaldo diario en GitHub del código, una base de conocimiento de Obsidian como memoria del proyecto (sección 9.3), comprobaciones de extremo a extremo con Chromium sin cabeza para la interfaz, y las herramientas detach-run + notify del estudio para trabajos en segundo plano auto-avisadores [H] (inventario de servicios y herramientas, septiembre de 2026).

9.3 La base de conocimiento: una memoria de proyecto auditable

Desde el 26 de agosto de 2026, el autor y sus agentes mantuvieron una base de conocimiento estructurada (una bóveda de Obsidian) en la que se registra cada sesión de trabajo: el trabajo realizado, las decisiones tomadas, las próximas acciones y el archivo del que proviene cada dato, con frontmatter que registra la procedencia y una marca verified: true/false [H] (convenciones de la bóveda, agosto–septiembre de 2026). La bóveda es la razón por la que este artículo puede citar fechas y citas: cuando este borrador dice «registro de sesión, 6 de septiembre de 2026», apunta a un archivo que existe, que se escribió ese día y que lleva sus propias notas de fuente. Dos convenciones de esa bóveda merecen mencionarse como método: se supone que toda afirmación declara su fuente, y la historia nunca se inventa —el material no confirmado se conserva, pero marcado como no verificado— [H] (convenciones de la bóveda). Esas convenciones son las convenciones de este artículo (Apéndice A).

9.4 Investigación de cero tokens y la regla de lo local primero

La regla permanente del autor —visible en la nota de proyecto del 29 de agosto de 2026— es que la API local es la superficie de investigación: /lexemes, /concepts, /analyze responden preguntas sobre el corpus con cero tokens de LLM gastados [H]. El mismo instinto de lo local primero gobierna los datos (todo auto-alojado; nada depende de un proveedor), el dinero (solo niveles gratuitos y datos abiertos; sección 10) y la privacidad (los secretos nunca salen de la máquina; la base de conocimiento es privada) [H] (registros de sesión, septiembre de 2026).

9.5 Salvaguardas en una máquina frágil

Como la papa no tiene margen de maniobra, el estudio construyó salvaguardas que son en sí mismas parte de la historia de la ingeniería: un guardián de memoria/térmico (tools/mem-manager.sh, v2, en vivo el 7 de septiembre de 2026) que avisa por debajo de 900 MiB de memoria disponible o 80 °C y descarta unidades opcionales en segundo plano por debajo de 500 MiB o 88 °C, más un early-oom killer a nivel de sistema (earlyoom -m 8 -s 5, es decir, actúa cuando la memoria libre se desploma por debajo del 8%, con una cadencia de 5 segundos) [H] (configuración en vivo: umbrales de mem-manager.sh y /etc/default/earlyoom, leídos el 7 de septiembre de 2026). Las reglas operativas del estudio evitan que esas salvaguardas tengan que actuar alguna vez: una operación pesada a la vez, envoltorios con protección de memoria y trabajos separados auto-avisadores para todo lo que dure mucho. Las reparaciones largas se escriben para ser idempotentes (get-or-create, skip-if-exists), de modo que cualquier interrupción —un reinicio, una pérdida de energía, un disparo de la salvaguarda— solo cueste tiempo: la reparación puede simplemente relanzarse y terminará el trabajo (sección 7.3). La misma disciplina trata a la propia concurrencia como un recurso que presupuestar, igual que la memoria o el disco.

9.6 Gobernanza: licencias, atribución y la decisión «gratis para siempre»

Todo conjunto de datos entró en Lingua Mundi con su licencia registrada (el inventario docs/DATA_LICENSES.md del repositorio; la tabla source de la base de datos en vivo) [H]: WordNet (permisiva), el Open Multilingual Wordnet (licencias por idioma, predominantemente CC BY-SA y CC BY), Wiktionary y kaikki (CC BY-SA, con términos heredados de GFDL), Wikidata (CC0), UniMorph (CC BY-SA 3.0), Universal Dependencies (CC BY-SA 4.0), JMdict/KANJIDIC2 y la familia EDRDG (permisivas, con atribución), OPUS (por conjunto de datos), CLICS y las listas de frecuencia de palabras (por fuente), y así sucesivamente [H] (inventario de licencias, consultado en septiembre de 2026). El proyecto corresponde: sus propias salidas están planeadas para ser también gratuitas.

El modelo de financiación evolucionó públicamente a lo largo de nueve días entre finales de agosto y principios de septiembre de 2026, y el registro muestra cada paso [H] (registros de sesión y calendario, 29 de agosto – 7 de septiembre de 2026): un plan inicial, el 29 de agosto, de vender una aplicación de diccionario sin conexión del Core 6 (Texupan, $29 o $9/mes); una ficha de tienda con enlaces de pago en el centro de la tienda hacia el 1 de septiembre; y —para el 7 de septiembre— una decisión de hacer Lingua Mundi gratis para siempre, financiado con donaciones voluntarias, con el producto de Stripe literalmente llamado "Lingua Mundi — keep it free forever", precios únicos de €5/€15/€50 y mensuales de €3/€9/€25, y una meta anual honesta de €2,400 para cubrir la infraestructura y el trabajo de datos del siguiente idioma [H] (registro de sesión, 7 de septiembre de 2026). La cuenta se configuró deliberadamente inactiva —donaciones deshabilitadas hasta que el autor complete la verificación de identidad del proveedor de pagos—, de modo que «gratis para siempre» sea, en el encuadre del autor, una afirmación verificable, no un eslogan [H] (registro de sesión, 7 de septiembre de 2026). El texto público sigue la regla de la voz del estudio (aviso inicial) y la regla de la copia honesta: nada de bombo, nada de sobreafirmaciones —la misma disciplina que gobierna la base de datos y este artículo—.

10 · Dónde está el proyecto (7 de septiembre de 2026), sus límites honestos y el camino por delante

10.1 Estado actual del sistema

Medido directamente contra el sistema en vivo el 6–7 de septiembre de 2026 [H] (véase el Apéndice A para las consultas exactas):

  • Corpus (instantánea previa a la reparación, 6–7 de septiembre de 2026):

96,434 conceptos · 1,238,383 lexemas · 1,608,018 sentidos · 171,672 relaciones, en seis idiomas en vivo (inglés, español, francés, alemán, portugués, japonés) — los conteos SQL se reprodujeron de forma idéntica en ambas fechas de medición.

  • Corpus (posterior a la reparación, 8 de septiembre de 2026): 125,980

conceptos / 125,980 synsets / 352,333 lexemas ingleses, tal como consta en el informe de la reparación (lm-en-coverage-REPORT-2026-09-08.txt, RESULT: PASS); los miembros multilingües de la estrella cat princeton-wordnet:02121620-n abarcan inglés, español, japonés, alemán y portugués (cat, gato, 猫, Katze, Gato doméstico).

  • Vistas de clasificación: concept_sky_rank 94,498 filas;

concept_lang_rank 218,120 filas; concept_word_rank 338,378 filas en su creación (se denegó un re-conteo en vivo al rol estándar de la base de datos; marcado [NV]).

  • Rendimiento: cielo por defecto ≈ 0.25 s en caliente (8.6 s antes de las

vistas de clasificación); consulta profunda de 1,000 estrellas con palabras ≈ 1.1 s (>60 s antes de la vista de palabras); búsquedas de caminos en el grafo en milisegundos; búsqueda ≈ 0.5 s en caliente / ≈ 10 s en frío con la caché de páginas del disco duro.

  • Interfaz: explorador de grafo semántico en vivo en el origen web de la

API, con todos los instrumentos (dial de exposición, sextante, marcas del cielo, brújula de palabras, cuaderno de bitácora, sello de época) verificados por 23/23 comprobaciones de extremo a extremo en navegador sin cabeza el 6–7 de septiembre de 2026.

  • Reparación de la cobertura del inglés: la cadena de re-importación sin

tope del WordNet inglés, relaciones, integración, refresco de vistas y verificación de extremo a extremo (sección 7.3) se lanzó en la mañana del 7 de septiembre de 2026 y corrió hasta completarse el 8 de septiembre de 2026 a las 22:19 (2026-09-08 22:19:12). Su compuerta de aceptación pasó: el informe de la propia cadena (lm-en-coverage-REPORT-2026-09-08.txt, RESULT: PASS) registra el sentido inglés de cat vinculado al concepto princeton-wordnet:02121620-n, cuyos miembros multilingües incluyen cat, gato, 猫, Katze, Gato doméstico [H] (informe, 8 de septiembre de 2026).

  • Gobernanza: canal de donaciones en vivo, pero deliberadamente inactivo

a la espera de la verificación del autor con el proveedor de pagos; código respaldado a diario; base de conocimiento al día.

10.2 Lo que honestamente no se sabe, y lo que está sin resolver

Las convenciones de verificación del estudio exigen que este artículo diga con franqueza lo que no pudo verificar y que registre las contradicciones entre fuentes. Las importantes:

  1. La discrepancia del «Core 6». El conjunto personal de idiomas del

autor (registrado el 29 de agosto de 2026) es español, inglés, japonés, francés, italiano y portugués. Los seis idiomas de la base de datos en vivo son inglés, español, francés, alemán, portugués y japonés. El alemán sustituyó al italiano en la base de datos sin ninguna explicación escrita sobreviviente; la fila del italiano y sus conjuntos de datos se registraron antes, pero la tabla en vivo contiene alemán [H] con la razón [NV] (véase también la sección 4.2 sobre los niveles de la especificación, que incluían mandarín e italiano, pero no alemán —tres conjuntos publicados distintos de idiomas en tres meses—).

  1. Desviación de los conteos del corpus dentro de un mismo día. Un

dossier técnico escrito el 6 de septiembre de 2026 reporta 1,146,066 lexemas / 1,595,537 sentidos, mientras que el SQL directo de esa misma noche reporta 1,238,383 / 1,608,018 (conceptos y relaciones idénticos: 96,434 / 171,672); el registro de sesión de esa misma noche lleva una tercera cifra intermedia (≈1.15 millones de lexemas), coherente con importaciones que seguían aterrizando a lo largo del día. Las sumas por idioma concilian con la cifra SQL, así que los números del dossier parecen venir de un momento o filtro distinto; la discrepancia no está explicada en los registros [H] con la conciliación [O]. Este artículo cita las cifras SQL con su fecha.

  1. Los registros de hardware se contradicen. La máquina que alojaba el

sistema en vivo en septiembre de 2026 se capturó directamente para este artículo como una ASUS X751MA con un Intel Pentium N3540 (Bay-Trail), 8 GB de RAM (sección 9.1) [H]. El registro escrito es más desordenado: las notas del proyecto describen el equipo como un Intel Atom Bay-Trail (Z36xx/Z37xx) y como un Pentium N3540 —la misma generación de silicio bajo dos nombres comerciales [O]—, mientras que los registros de conversación de 2026 más antiguos mencionan una máquina distinta, un Intel Jasper Lake "N5105" con 12 GB de RAM (enero de 2026), y más tarde «un chip Jasper Lake 4» (mayo de 2026) e «Intel Jasper Lake N5105, 4 GB» (archivo de memoria de mediados de 2026). Jasper Lake no es silicio Bay-Trail, así que los registros describen o bien dos máquinas distintas a lo largo del año, o bien un etiquetado erróneo de los asistentes; la evidencia sobreviviente no puede decidir cuál, y el punto se señala aquí en lugar de alisarse [H] con la conciliación [NV] (registros de sesión y de conversaciones con IA, enero–septiembre de 2026).

  1. Advertencias de calidad de datos de la auditoría de septiembre: el

corpus contiene 178,576 pares de lemas duplicados; 124,790 lexemas sin sentido; el 33.9% de las definiciones vacías; y (antes de la reparación del inglés) el 71.7% de los sentidos aún no vinculados a conceptos. La misma auditoría encontró que la integridad referencial se mantenía en todo momento (sumas exactas, cero filas colgadas o huérfanas a nivel de base de datos): la cifra de 71.7% describe sentidos aún no vinculados a un concepto —el estado diseñado de huérfano visible—, no referencias rotas: una distinción honesta que el proyecto mantiene deliberadamente a la vista mientras continúa el trabajo de alineación [H] (auditoría, 5–6 de septiembre de 2026).

  1. Sin medir o pendientes: el rendimiento en hardware distinto de la papa

nunca se ha medido; el proyecto aún no tiene usuarios públicos, así que no hay métricas de uso real; la estructura legal del estudio no está documentada en los registros; la cuestión de modelado de «las dos Coreas», la escasez de datos del cantonés y la revisión de licencias del wordnet taiwanés están abiertas (sección 10.3).

10.3 El camino por delante

La hoja de ruta, aprobada por el usuario el 29 de agosto de 2026, es la forma madura de los siete grafos del manuscrito de junio [H] (nota de proyecto): fonética/fonología, morfología (importada), sintaxis (importada), semántica (importada), lexicografía (importada), corpus (importados) y —en cola— discurso, etimología y las capas de correspondencia y uso, más la eventual interfaz web pública. En el corto plazo, los planes documentados son [H] (registros de sesión, 7 de septiembre de 2026):

  • La familia CJKV. Los siguientes idiomas planeados para el esquema son el

mandarín (cmn), el cantonés (yue), el coreano (kor) y el vietnamita (vie). Su calendario depende de un reconocimiento de disponibilidad de datos que es honesto sobre lo que ofrece el panorama de datos abiertos: existen wordnets de Wiktionary en el OMW para el mandarín (19,079 filas), el cantonés (527), el coreano (9,268) y el vietnamita (5,498); y treebanks de UD para el mandarín (123k tokens), el cantonés (14k), el coreano (80k GSD más 350k Kaist) y el vietnamita (58k). El cantonés es el escaso —sin wordnet grande, con treebank pequeño—, y las licencias del wordnet taiwanés están bajo revisión [H] (registro de sesión e inventario de datos, 7 de septiembre de 2026). Hasta la fecha de este borrador no se ha importado ningún conjunto de datos CJKV al corpus en vivo; el momento de la familia es una decisión abierta a la espera de esa revisión.

  • Los paneles de interfaz research-v1 (lente de palabra, ascenso de

linaje, tarjetas de campo, cuaderno, tabla de comparación) se diseñaron y aprobaron en el backend el 6 de septiembre de 2026 y quedaron en cola detrás de la construcción de los instrumentos [H].

  • Publicación. Este artículo es un borrador preliminar generado por IA; la

publicación escrita por humanos está en desarrollo (aviso inicial).

  • Idiomas sin fin. La promesa del esquema —añadir un idioma como una fila

más conjuntos de datos— es la meta declarada a largo plazo del proyecto, y el texto de las donaciones lo dice con claridad: Lingua Mundi empieza con seis idiomas, construida para añadirlos indefinidamente [H] (registro de sesión, 7 de septiembre de 2026).

10.4 Conclusión

Lo que comenzó el 3 de diciembre de 2025 como una solicitud de archivos de diccionario gratuitos es hoy un mapa de significados de seis idiomas, en funcionamiento y consultable, construido sobre datos abiertos por una sola persona con herramientas gratuitas y una computadora portátil de 2014. Las ideas que lo llevaron —que el significado es la unidad natural de los datos multilingües; que la alineación debe ser explícita y etiquetada, nunca adivinada en silencio; que el cómputo costoso debe hornearse una vez y leerse muchas veces; que una restricción de presupuesto es una herramienta de diseño; que toda afirmación, en una base de datos o en un artículo, debe llevar su fuente y su fecha— no son nuevas, pero son verdaderas, y el proyecto demuestra que una persona puede actuar sobre ellas. Su artefacto más valioso puede no ser la base de datos en absoluto, sino la demostración de que un investigador solitario puede construir infraestructura honesta en público: midiendo lo que mide, fechando lo que fecha, mostrando sus huérfanos y cumpliendo su palabra —una estrella, seis idiomas y todo el cielo todavía por delante—.

Construido en una cueva, con un montón de chatarra.

Referencias

Edición 7 de APA. Los detalles bibliográficos se verificaron contra las páginas de los editores y los registros de identificadores de objetos digitales (DOI) el 7 de septiembre de 2026. Las fuentes de software y de datos se citan según los formatos de software y de conjuntos de datos de APA. (Solo se listan las obras citadas en el texto.)

Bond, F., & Foster, R. (2013). Linking and extending an open multilingual wordnet. In Proceedings of the 51st Annual Meeting of the Association for Computational Linguistics (pp. 1352–1362). Association for Computational Linguistics. https://aclanthology.org/P13-1133/

Braille Institute of America. (2019). Atkinson Hyperlegible [Computer font]. https://brailleinstitute.org/freefont

Breen, J. W. (2004). JMdict: A Japanese-multilingual dictionary. In Proceedings of the Workshop on Multilingual Linguistic Resources (COLING 2004) (pp. 65–72). COLING. https://aclanthology.org/W04-2209/

Electronic Dictionary Research and Development Group. (n.d.). JMdict / EDICT Japanese–English dictionary project [Data files and documentation]. Retrieved September 7, 2026, from https://www.edrdg.org/jmdict/edict_doc.html

Fellbaum, C. (Ed.). (1998). WordNet: An electronic lexical database. MIT Press. https://mitpress.mit.edu/9780262561167/wordnet/

Gaia Collaboration, Brown, A. G. A., Vallenari, A., Prusti, T., de Bruijne, J. H. J., Babusiaux, C., … Zwitter, T. (2018). Gaia Data Release 2: Summary of the contents and survey properties. Astronomy & Astrophysics, 616, Article A1. https://doi.org/10.1051/0004-6361/201833051

Hernández, R. (2026, June 1). Lingua Mundi: A semantic infrastructure for concept-grounded language models (Versions 1–7) [Unpublished manuscript; revision and audit records preserved in the author's conversation-log archive].

Hernández, R. (2026, July 24). Multilingual Lexical Platform — Engineering specification (Version 2.0) [Unpublished specification document; text extraction on file].

Kirov, C., Cotterell, R., Sylak-Glassman, J., Walther, G., Vylomova, E., Xia, P., Faruqui, M., Mielke, S. J., McCarthy, A., Kübler, S., Yarowsky, D., Eisner, J., & Hulden, M. (2018). UniMorph 2.0: Universal morphology. In Proceedings of the Eleventh International Conference on Language Resources and Evaluation (LREC 2018). European Language Resources Association. https://aclanthology.org/L18-1293/

McCarthy, A. D., Kirov, C., Grella, M., Nidhi, A., Xia, P., Gorman, K., Vylomova, E., Mielke, S. J., Nicolai, G., Silfverberg, M., Arkhangelskiy, T., Krizhanovsky, N., Krizhanovsky, A., Klyachko, E., Sorokin, A., Mansfield, J., Ernštreits, V., Pinter, Y., Jacobs, C. L., … Yarowsky, D. (2020). UniMorph 3.0: Universal morphology. In Proceedings of the Twelfth International Conference on Language Resources and Evaluation (LREC 2020) (pp. 3922–3931). European Language Resources Association. https://aclanthology.org/2020.lrec-1.483/

Meyer, C. M., & Gurevych, I. (2012). Wiktionary: A new rival for expert-built lexicons? Exploring the possibilities of collaborative lexicography. In S. Granger & M. Paquot (Eds.), Electronic lexicography (pp. 259–292). Oxford University Press. https://doi.org/10.1093/acprof:oso/9780199654864.003.0013

Miller, G. A. (1995). WordNet: A lexical database for English. Communications of the ACM, 38(11), 39–41. https://doi.org/10.1145/219717.219748

Nivre, J., de Marneffe, M.-C., Ginter, F., Hajič, J., Manning, C. D., Pyysalo, S., Schuster, S., Tyers, F., & Zeman, D. (2020). Universal Dependencies v2: An evergrowing multilingual treebank collection. In Proceedings of the Twelfth International Conference on Language Resources and Evaluation (LREC 2020) (pp. 4034–4043). European Language Resources Association. https://aclanthology.org/2020.lrec-1.497/

Princeton University. (n.d.). About WordNet. WordNet. Retrieved September 7, 2026, from https://wordnet.princeton.edu/

SIL International. (n.d.). ISO 639-3. Retrieved September 7, 2026, from https://iso639-3.sil.org/

de Saussure, F. (1983). Course in general linguistics (C. Bally, A. Sechehaye, & A. Riedlinger, Eds.; R. Harris, Trans.). Duckworth. https://www.bloomsbury.com/us/course-in-general-linguistics-9781472508829/ (Original work published 1916)

Speer, R. (2022). wordfreq: A database of word frequencies in many languages (Version 3.0) [Computer software]. GitHub. https://github.com/rspeer/wordfreq

Tiedemann, J. (2012). Parallel data, tools and interfaces in OPUS. In Proceedings of the Eighth International Conference on Language Resources and Evaluation (LREC 2012) (pp. 2214–2218). European Language Resources Association. https://aclanthology.org/L12-1246/

Vrandečić, D., & Krötzsch, M. (2014). Wikidata: A free collaborative knowledgebase. Communications of the ACM, 57(10), 78–85. https://doi.org/10.1145/2629489

Wikimedia Foundation. (n.d.). Wiktionary: The free dictionary. Retrieved September 7, 2026, from https://www.wiktionary.org/

Zipf, G. K. (1949). Human behavior and the principle of least effort. Addison-Wesley Press. https://archive.org/details/humanbehaviorpri0000zipf

Apéndice A · Fuentes, método y verificación

A.1 La convención de anotación

Siguiendo el estándar de rigor del estudio (heredado de su trabajo de investigación), las afirmaciones de este artículo se etiquetan allí donde el lector necesita conocer su estatus epistémico: [H] = dato verificado —una medición, un código o una fuente fechada consultada para este artículo—; [O] = interpretación u opinión atribuida; [NV] = no verificado / no localizado. Toda cifra del resumen y del cuerpo es una medición [H] con su fecha o está etiquetada.

A.2 Familias de fuentes consultadas (acceso: 6–7 de septiembre de 2026)

#FuenteQué proporcionó
1Código en vivo: …/SafeMode/Software Development/LinguaMundi/lingua-mundi (api/, core/, schemas/, importers/, scripts/, docs/, gui/)Arquitectura, esquema, importadores, SQL de vistas materializadas, rutas de la API, código de la GUI
2Base de datos en vivo lingua_mundi (PostgreSQL, 127.0.0.1:5433), SQL directoConteos del corpus, tabla de idiomas, membresía de synsets, vínculos de conceptos
3API en vivo (127.0.0.1:8765): /languages, /graph/sky, /graph/star, /graph/word, /graph/path, /openapi.jsonComportamiento de los endpoints, latencias en caliente/frío, gzip
4Interfaz web (127.0.0.1:8765/gui) + comprobaciones con navegador sin cabeza (headless)Comportamiento de la interfaz; 23/23 comprobaciones de extremo a extremo registradas el 6–7 de septiembre de 2026
5Base de conocimiento (bóveda): registros de sesión del 26 de agosto al 7 de septiembre de 2026, entregas, notas de proyecto, convencionesHitos, decisiones, citas, convenciones, fechas
6Archivo de conversaciones de ChatGPT (exportación del 5 de septiembre de 2026; 421 conversaciones con contenido)Conversaciones de origen y crecimiento, citas textuales (secciones 1, 3, 4)
7Exportación de datos de DeepSeek (6 de septiembre de 2026; 215 conversaciones)Ciclo de revisión del manuscrito de junio de 2026, registros de configuración
8Exportación de datos de Claude.ai (extraída el 6 de septiembre de 2026; archivo de memoria heredada actualizado el 7 de septiembre de 2026)Contexto de largo horizonte, roles del proyecto
9Artefactos personales en el directorio personal del autor (marcas de tiempo de archivos, scripts, PDF de la especificación, diarios)Cronología previa al proyecto (noviembre–diciembre de 2025), especificación de ingeniería, diarios
10Fuentes académicas y de datos publicadas (véase Referencias)Antecedentes y trabajo relacionado

Consultas de verificación representativas (ejecutadas el 7 de septiembre de 2026, rol lingua): SELECT count(*) FROM concept|lexeme|sense|relation → 96,434 / 1,238,383 / 1,608,018 / 171,672; SELECT code FROM language → deu, eng, fra, jpn, por, spa; membresía del synset 02121620-n por idioma (sección 8.5); el script de aceptación propio del proyecto verify-lm-cat-demo.sh (sección 7).

A.3 Cifras clave con fechas (línea de tiempo condensada)

FechaHecho / cifra
2025-11-11KANJIDIC2 descargado (primer conjunto de datos, marca de tiempo del archivo)
2025-12-03Mensaje de origen: «base de datos multilingüe unificada» (registro de ChatGPT)
2025-12-05Datos del OMW descargados; primeros scripts de extracción
2025-12-08…16Canal de importación de fusión/unificación; esquema JSONL de cuatro entidades (concept/sense/lexeme/grapheme)
2026-05-01Estudio de cobertura de OMW v2.0
2026-05-23Maestro de especificación "Multilingual Lexical Platform" (markdown)
2026-06-01Se nombra Lingua Mundi; ciclo de revisión del manuscrito V1–V7 (auditorías de DeepSeek + ChatGPT)
2026-07-17/18Andamiaje de código; conversación de viabilidad; diario
2026-07-24Especificación de ingeniería V2 (104 págs., PDF)
2026-08-13Decisión de la pila ligera; capa de interacción semántica
2026-08-19…25Construcciones de la demostración japonesa; descripciones del concepto del 23 de agosto
2026-08-27Comienzan los respaldos diarios en GitHub
2026-08-29Decisión "LinguaMundi IS the lexicon"; hoja de ruta aprobada; Core 6; Postgres en vivo; importador de UD
2026-08-30Rutas de la API (CORS, /lookup, /kanji); 27 pruebas en verde; primer despliegue de /gui
2026-08-31Reinicio de la importación (~1.13M filas); el tope del OMW en inglés sembró el error de cat
2026-09-01Nombramiento del Planetario; ≈1.54M filas; tienda en vivo
2026-09-05Auditoría profunda; arreglos de paginación; 1,238,383 lexemas
2026-09-06Auditoría de enriquecimiento; reforma de las vistas materializadas (94,498 / 218,120); horneado de palabras (338,378); giro de la GUI hacia el explorador de grafo semántico; causa raíz de cat; aprobación de research-v1
2026-09-07Instrumentos en vivo (23/23 E2E); configuración de donaciones (inactiva); cadena de reparación de la cobertura del inglés lanzada; reconocimiento de disponibilidad de datos CJKV; este artículo redactado
2026-09-08Reparación de la cobertura del inglés verificada como completa (8 de septiembre de 2026 a las 22:19); compuerta de aceptación PASS registrado en lm-en-coverage-REPORT-2026-09-08.txt

A.4 Contradicciones y asuntos sin resolver

Como se documenta en la sección 10.2: la discrepancia del «Core 6» italiano/alemán; la desviación de los conteos del corpus dentro del mismo día (dossier de 1,146,066 frente a 1,238,383 lexemas del SQL, con una tercera cifra intermedia en el registro de sesión de esa misma noche, conciliada por idioma con la cifra SQL); el conflicto de los registros de hardware (Atom Bay-Trail frente a Pentium N3540 frente a un Jasper Lake N5105 en los registros de principios de 2026 —sección 10.2, punto 3—); el 71.7% de sentidos sin vincular y demás advertencias de calidad de datos; y los asuntos no verificados/no documentados: la fecha exacta de fundación del repositorio antes del 26 de agosto, la razón del cambio del conjunto de idiomas, la procedencia del modelo de los textos de auditoría del 1 de junio (las auditorías sobreviven en la conversación de ChatGPT del autor, desde el lado del usuario; qué modelo asistente escribió cada ronda de auditoría no está atestiguado de forma independiente en la exportación —véase la sección 3.3—), el re-conteo en vivo de concept_word_rank (permiso denegado) y la estructura legal del estudio.

A.5 Notas metodológicas

  • El sistema bajo prueba es el sistema de producción; las mediciones en

caliente llevan ±0.3 s de ruido del disco duro; las fechas y horas se dan en la zona horaria propia de los registros (hora central salvo indicación; los registros de DeepSeek usan +08:00 y se convirtieron).

  • Las citas son textuales de los registros/archivos citados; los puntos

suspensivos marcan cortes; las citas en inglés se traducen en el cuerpo donde se usan.

  • Este artículo es en sí mismo un borrador generado por IA (aviso inicial);

se escribió bajo la dirección del autor a partir de las fuentes anteriores y no ha sido revisado por pares. Herramientas de verificación: SQL directo, consultas HTTP, comprobaciones con navegador sin cabeza y lecturas de archivos fuente; ninguna afirmación se completó de memoria cuando existía una fuente.

Apéndice B · Glosario — términos en lenguaje sencillo usados en este artículo

Cómo usar este glosario: la primera vez que un término técnico aparece en el artículo se subraya con puntos —pase el cursor sobre él (o tóquelo) para ver una definición rápida, o haga clic para saltar aquí—. Esta lista sigue el orden alfabético de los términos originales en inglés.
Alineación
el acto de decidir que una palabra en un idioma significa lo mismo que una palabra en otro.
API
una interfaz que permite que un programa le pida datos a otro (p. ej., una aplicación de diccionario pidiéndole una palabra a la base de datos de Lingua Mundi).
Autónimo
el nombre con el que los propios hablantes de un idioma lo llaman (los hispanohablantes llaman español al español).
Hornear
la palabra del proyecto para calcular una respuesta costosa una sola vez, almacenarla y leerla muchas veces (la regla de trabajo es «hornear, no volver a derivar»).
Búsqueda en amplitud
una forma de explorar un grafo hacia afuera por capas, como las ondas que hace una piedra en el agua, para encontrar la ruta más corta entre dos puntos.
CJKV
una abreviatura de la familia de sistemas de escritura que abarca el chino, el japonés, el coreano y el vietnamita (las letras corresponden a los nombres de las escrituras).
Concepto
un significado compartido entre idiomas (en este artículo, «la idea de gato doméstico», no una palabra concreta).
Corpus
una gran colección de datos de idioma (textos o entradas de diccionario) usada como evidencia.
Conjunto de datos
una colección empaquetada de datos de una sola fuente, con su propio formato y su propia licencia.
Derivación
la derivación es cómo se construyen palabras nuevas a partir de otras existentes (run → runner); la etimología es la historia de una palabra a través del tiempo y de los idiomas.
ETL
extraer-transformar-cargar: el proceso de leer datos de una fuente externa, reformatearlos y almacenarlos en la base de datos.
FastAPI
un marco (framework) de Python gratuito y de código abierto para construir el tipo de interfaz (API) que sirve este proyecto.
Búsqueda de texto completo
buscar en una base de datos cotejando palabras dentro del texto almacenado, en lugar de por identificadores exactos.
Grafema
un carácter escrito: una letra de un alfabeto, un signo de sílaba o un kanji.
Grafo
en este artículo, un conjunto de significados (nodos) conectados por relaciones tipadas (aristas).
Gzip
un método estándar de compresión que hace más pequeños los archivos antes de que viajen por internet.
HTTP
el protocolo que usan los navegadores web y las API para pedir y recibir datos por internet.
Hiperónimo
hiperónimo significa «un tipo de»: felino es hiperónimo de gato doméstico. Una taxonomía es el árbol de tipos resultante.
Importador
un programa que sabe leer un conjunto de datos externo y escribirlo en el esquema propio de Lingua Mundi.
Índice
una estructura de base de datos que permite a las consultas encontrar filas rápido, como el índice de un libro en lugar de leer todas las páginas.
Flexión
la flexión es cambiar la forma de una palabra por razones gramaticales (run → ran); la morfología es el estudio de esas formas.
Instancia-de
dos tipos de relación en el grafo: «esto es un ejemplo de aquello» (un gato es una instancia de un tipo de mamífero) y «esto es una pieza de aquello» (una pata es parte de un gato).
Interlingua
una representación intermedia compartida entre idiomas: en lugar de traducir directamente español→inglés, pasar por español→significado→inglés.
ISO 639-3
el estándar internacional que asigna a cada idioma humano un código único de tres letras (spa = español, jpn = japonés).
JMdict
JMdict es un gran diccionario japonés-multilingüe; KANJIDIC2 es su archivo complementario de kanji (caracteres de origen chino usados en japonés) con lecturas y significados.
JSON Lines
un formato de texto simple en el que cada línea es un registro de datos, usado en los primeros archivos del canal de importación del proyecto.
Kaikki
una extracción legible por máquina de los datos de Wiktionary, más fácil de leer para los programas que las páginas originales.
Kanji
los caracteres de origen chino usados en el japonés escrito.
Lema
la forma de diccionario de una palabra (la forma que se busca: cat, no cats; run, no ran).
Lexema
una forma de palabra en un idioma específico (la cadena cat).
Licencia
los términos legales que establecen cómo pueden usarse y compartirse los datos; las licencias «abiertas» permiten la reutilización con atribución (p. ej., CC BY-SA).
Cola larga
la gran masa de elementos raros en el extremo lejano de una distribución zipfiana (véase la ley de Zipf).
Vista materializada
un resultado de consulta precomputado y almacenado, refrescado según un calendario, para que las preguntas repetidas no rehagan el trabajo (el patrón de «hornear»).
Morfología
el estudio de las formas de palabra y de cómo cambian por razones gramaticales (véase flexión).
Lenguaje natural
el idioma humano tal como la gente realmente lo habla y lo escribe, en oposición a los lenguajes de programación.
Nodo
en un grafo, un nodo es un elemento (aquí, un concepto) y una arista es una conexión entre dos elementos (aquí, una relación tipada).
OMW
la colección de WordNets alineados con el WordNet inglés.
OPUS
una gran colección de oraciones traducidas reunidas desde la web y desde los subtítulos de películas.
Sentido huérfano
un significado de diccionario aún no vinculado a un concepto compartido; se conserva visible en lugar de oculto.
Paginación
dividir una lista larga de resultados en páginas numeradas en lugar de enviarlo todo de una vez.
Categoría gramatical
la clase gramatical de una palabra: sustantivo, verbo, adjetivo, etcétera.
Canal de importación
una cadena de programas que lleva los datos desde una fuente en bruto, a través de pasos de limpieza, hasta su hogar final.
Plugin
un plugin es un pequeño programa complementario para un conjunto de datos; el registro es la lista única y autoritativa de ellos.
Polisemia
una palabra con varios significados (bank: la orilla de un río o una entidad financiera).
PostgreSQL
una base de datos relacional gratuita y de código abierto (el sistema donde Lingua Mundi almacena todo).
Relación
una conexión tipada y dirigida entre dos conceptos (gato doméstico es un felino).
Esquema
el plano de una base de datos: qué tablas existen, qué contiene cada fila y cómo se refieren las tablas entre sí.
Sentido
un significado de una palabra tal como lo registra un diccionario.
Significante
las dos caras de la palabra según Saussure: su sonido o forma (significante) y el concepto al que apunta (significado).
Brillo en el cielo
la clasificación del proyecto de cuán «importante» es un significado, según cuántos idiomas y palabras se le adosan.
SQL
el lenguaje estándar para hacer preguntas a una base de datos relacional.
Synset
un conjunto de palabras que pueden expresar el mismo significado en algún contexto; en Lingua Mundi, el significado de un synset se almacena como concepto.
Token
en el aprendizaje automático, el fragmento pequeño de texto (a menudo una palabra o parte de una palabra) que un modelo lee o escribe.
Treebank
una colección de oraciones reales anotadas con su gramática (qué palabra desempeña qué función).
UD
un proyecto comunitario que publica datos de oraciones con anotación gramatical en muchos idiomas, bajo licencias abiertas.
UniMorph
un repositorio multilingüe de datos de formas de palabra (flexivos).
URI
una dirección estable y única para una cosa; aquí se usa para los conceptos (p. ej., princeton-wordnet:02121620-n para gato doméstico).
Wikidata
la base de conocimiento estructurado de Wikimedia, con afirmaciones con identificadores legibles por máquina, publicada bajo CC0.
Wiktionary
el diccionario colaborativo alojado por la Fundación Wikimedia.
Forma de palabra
una grafía de una palabra en un idioma; véase lexema.
WordNet
la base de datos léxica original en inglés, organizada por significado (Princeton); el OMW alinea otros idiomas con ella.
Wordfreq
una base de datos de listas de frecuencia de palabras en varios idiomas, usada para clasificar las palabras según lo comunes que son.
Escritura
el conjunto de caracteres en que se escribe un idioma (latino, árabe, caracteres chinos, etcétera).
Ley de Zipf
la observación de que unas pocas palabras explican la mayor parte del uso y de que la cola larga de palabras raras explica el resto.