El fin del corpus humano

Si un campesino de la Sierra Juárez guardara para la siguiente siembra la peor semilla de la cosecha, la más plagada y estéril, y repitiera ese mismo gesto año tras año, el resultado previsible sería el colapso de su milpa. Nadie que conozca la tierra esperaría que de la semilla enferma brote un maíz vigoroso. En el mundo de la Inteligencia Artificial, sin embargo, los dueños del capital tecnológico actúan como si pudieran saltarse esa ley básica de la regeneración.

Un saludo se convierte en un arrozal que no existe en la zona, gracias a la magia del traductor de google

Desde los principios de la programación existe una verdad básica: entra basura, sale basura. Sin importar qué tan sofisticado sea el algoritmo, si los datos que lo alimentan son deficientes, el resultado también lo será. Y esto se vuelve más urgente ahora: los modelos de lenguaje, la cara más conocida de la IA, se construyen y se mejoran a partir de un consumo inmenso de datos —prácticamente toda la producción de internet desde los años noventa. Además de  libros digitalizados, estos datos provienen especialmente de plataformas colaborativas como  Wikipedia, Reddit, y  foros: el trabajo voluntario de  miles de personas convertido  en el insumo gratuito para modelos  de empresas valoradas hoy en miles de millones de dólares.

El problema es que ese insumo se está agotando y corrompiendo a la vez. Un equipo de investigadores analizó más de 6,380 millones de oraciones de contenido multilingüe traducido en la web y encontró que el 57% de ese material específico mostraba patrones de traducción automática masiva, no producción humana. Buena parte de ese contenido se origina como texto de baja calidad en inglés, generado para ingresos publicitarios, y se traduce después en cadena a decenas de idiomas. Lo que esto significa es que los próximos modelos se entrenarán cada vez más con los resultados de modelos anteriores: la semilla enferma contamina la siguiente siembra. Un equipo de investigadores de Oxford, Cambridge y Toronto documentó este efecto en la revista Nature en 2024: los modelos de IA colapsan cuando se entrenan con datos generados de forma recursiva. La industria ya reacciona buscando datos frescos o depurando los existentes, pero el problema es real. Tal vez no se llegue a un colapso total, pero como mínimo se eleva el costo de desarrollar modelos y puede amplificar los sesgos ya existentes.

Para las lenguas con poca presencia digital, este proceso resulta particularmente devastador. El 11% de respuestas contaminadas que el estudio de LLYC, BID Lab y Microsoft documentó en lenguas indígenas (hispanismos, bucles lógicos, disculpas automatizadas) es apenas el principio de un ciclo más largo. Wikipedia es al mismo tiempo un repositorio del conocimiento colectivo de la humanidad y uno de los insumos principales para entrenar modelos de lenguaje. Para las lenguas indígenas, la combinación resulta fatal: sistemas de escritura no estandarizados, pocos voluntarios disponibles y la facilidad técnica de generar traducciones automáticas a partir de corpus escasos produce exactamente lo que uno esperaría. Traducciones deficientes que se publican como si fueran legítimas se usan para entrenar la siguiente generación de modelos, y cada iteración se aleja más de la lengua real.

Un estudio de MIT Technology Review encontró que entre el 40% y el 60% de los artículos revisados en varias lenguas africanas de Wikipedia eran traducciones automáticas plagadas de errores. El caso más dramático se resolvió en 2025: la Wikipedia en kalaallisut, la lengua groenlandesa con cerca de 57,000 hablantes, cerró formalmente porque la gran mayoría de sus artículos habían sido generados por máquinas y resultaban prácticamente incomprensibles para cualquier lector humano, en gran parte  porque no existía un solo editor activo que hablara la lengua como nativo. El corpus digital de una lengua viva se había convertido en algo que sus propios hablantes no reconocían. Eso fue un resultado del mismo automatismo, sin que nadie lo decidiera explícitamente: cuando no hay nadie escogiendo la semilla, la cosecha se degrada con el tiempo. 

No todas las lenguas pequeñas están condenadas a ese destino. El sami inari, hablado por apenas unos cientos de personas en el norte de Finlandia, estuvo al borde de la extinción hace cuatro décadas, con solo cuatro niños hablantes documentados. La comunidad decidió reconstruir su Wikipedia desde cero con una regla que no admitía excepciones: cada artículo debía ser revisado por una persona hablante fluida antes de publicarse. Hoy existen más de seis mil artículos en sami inari, y la edición se usa activamente en las escuelas que enseñan en esa lengua. “No nos importa la cantidad. Nos importa la calidad”, resume uno de los responsables del proyecto. El resultado no dependió de la tecnología sino de una comunidad organizada dispuesta a ejercer control sobre lo que entra a su corpus digital.

Las consecuencias para Oaxaca, con su enorme diversidad lingüística, no son alentadoras si no se organiza ese mismo control. Un algoritmo que falla de forma obvia se detecta y se corrige a tiempo. El riesgo mayor es más silencioso: una copia distorsionada de la lengua que circula como legítima. La citan estudiantes, la adoptan instituciones, la heredan y amplifican los próximos modelos. En lugar de preservar las lenguas, la tecnología puede contribuir activamente a su erosión.La semilla enferma no desaparece en la primera siembra: se propaga y va reduciendo la cosecha con cada ciclo.

La pregunta de quién va a vigilar lo que entra al corpus digital de las lenguas de Oaxaca es una pregunta de gobernanza comunitaria, y no se contesta con soluciones tecnológicas. El mismo principio aplica más allá de las lenguas: cuando los datos deficientes no son palabras sino perfiles de personas(currículums, rostros, historiales laborales), el resultado toma otra forma. Una persona mal clasificada por un sistema que decide, sin posibilidad de apelación, quién consigue el trabajo o quién levanta sospecha. Eso es lo que revisa el siguiente ensayo.

FUENTES 

Shumailov, I., Shumaylov, Z., Zhao, Y., Papernot, N., Anderson, R., & Gal, Y. (2024). AI models collapse when trained on recursively generated data. Nature, 631(8022), 755–759. https://doi.org/10.1038/s41586-024-07566-y

Thompson, B., Dhaliwal, M., Frisch, P., Domhan, T., & Federico, M. (2024). A Shocking Amount of the Web is Machine Translated: Insights from Multi-Way Parallelism. Findings of the Association for Computational Linguistics: ACL 2024, pp. 1763–1775. https://doi.org/10.18653/v1/2024.findings-acl.103

Judah, J. (2025, 25 de septiembre). How AI and Wikipedia have sent vulnerable languages into a doom spiral. MIT Technology Review. https://www.technologyreview.com/2025/09/25/1124005/ai-wikipedia-vulnerable-languages-doom-spiral/

LLYC, BID Lab y Microsoft (2025). El desempeño de la inteligencia artificial en el uso de lenguas indígenas americanas. publications.iadb.org

Meta-Wiki (2025). Proposals for closing projects/Closure of Greenlandic Wikipedia. Resolución adoptada el 27 de septiembre de 2025. https://meta.wikimedia.org/wiki/Proposals_for_closing_projects/Closure_of_Greenlandic_Wikipedia

1 comentario en “El fin del corpus humano”

  1. La lengua indígena sigue retoñando cada década debido a que la tecnología sin saber usarla en ese campo se desecha por ello no ha embobado en sus 4 lados que requieren.

Dejar un comentario

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *