Hay una escena que todavía pertenece a la ciencia ficción: una máquina que, después de haber aprendido todo lo que los humanos podían enseñarle, empieza a mirarse a sí misma. No es exactamente lo que está ocurriendo, todavía no, pero sí hay algo parecido sucediendo ... en el lugar menos misterioso y más cotidiano de nuestra época: aquí, en internet.
Durante años hemos imaginado la inteligencia artificial como una criatura hambrienta –tendemos a transferir nuestro apetito a todo tipo de objetos (de momento) inanimados, como la IA, o los agujeros negros–. Le suministramos libros, fotografías, películas, conversaciones, periódicos, código, dibujos, páginas web. Alimentamos sus modelos con cantidades de información que ningún ser humano podría leer durante cientos de vidas. La máquina come el mundo para aprender a representarlo.
La cuestión problemática comienza cuando, en el mundo que le ofrecemos, empiezan a aparecer cada vez más cosas producidas por ella misma.
Dataland, el primer museo para el arte IA, una obra de Refik Anadol
Un texto generado por inteligencia artificial se publica en una web. Una imagen creada con IA aparece en una red social. Una reseña sintética se mezcla con las reseñas humanas. Un artículo automático es indexado por un buscador. Otro modelo lo encuentra. Aprende de él. Genera otro texto. Ese texto vuelve a Internet. Y, algún día, otro modelo lo utilizará como material de entrenamiento. La máquina ha empezado a comerse sus propios sueños.
La expresión científica para una de las consecuencias posibles de este proceso es bastante menos hermosa: 'model collapse', colapso del modelo. Un estudio publicado en 'Nature' en 2024 mostró que cuando los modelos generativos son entrenados de manera sucesiva con datos producidos por modelos anteriores pueden perder progresivamente información de la distribución original. Las rarezas desaparecen antes. Los casos extremos se borran. La representación del mundo se va estrechando. Dicho de otra manera: cuando una copia empieza a sustituir al original, la copia deja de ser una copia inocente.
Supongamos una biblioteca en la que cada generación de escritores pudiera leer únicamente los libros escritos por la generación anterior. Al principio no sucedería gran cosa. Después empezarían a repetirse determinados argumentos, determinadas palabras, determinados personajes. Las excepciones resultarían cada vez menos frecuentes. Los estilos extravagantes desaparecerían. Los errores de un escritor podrían convertirse en convenciones para el siguiente.
Después de muchas generaciones, quizá todos los libros fueran impecable y soporíferamente parecidos, no porque alguien hubiese decidido que debían serlo, sino porque el sistema habría ido eliminando poco a poco todo aquello que se encontraba fuera de lo más probable.
Algo semejante puede ocurrir con los datos sintéticos. Y aquí aparece una paradoja particularmente contemporánea: la inteligencia artificial necesita internet para aprender, pero la inteligencia artificial está transformando internet en algo de lo que resulta cada vez más difícil aprender.
No porque el contenido generado por IA sea necesariamente malo: una imagen artificial puede ser extraordinaria. Un texto generado por un modelo puede resultar útil, preciso o incluso hermoso. Los datos sintéticos pueden servir para entrenar sistemas, simular situaciones y ampliar determinados conjuntos de datos. El problema aparece cuando ya no sabemos distinguir el origen.
Durante siglos, la cultura ha sido una cadena de transformaciones: alguien que escribe lee a otro alguien que escribe; un pintor mira a otro pintor; una cineasta recuerda una película; un músico interpreta, samplea y compone. Pero detrás de esas operaciones existe, aunque sea indirectamente, una experiencia del mundo. Una persona ha visto llover, ha perdido a alguien, ha estado en un lugar, ha sentido miedo, mentido, deseado algo. Ha observado un rostro durante demasiado tiempo.
Incluso cuando la cultura se alimenta de cultura, existe en algún punto un cuerpo mirando. La inteligencia artificial introduce una posibilidad diferente: una cultura que empiece a alimentarse de sus propias representaciones.
El asunto resulta especialmente inquietante porque los modelos generativos no buscan exactamente la verdad, sino regularidades. Aprenden qué suele aparecer después de qué, qué imágenes se parecen a otras, qué palabras tienen mayor probabilidad de acompañarse. Su extraordinaria capacidad procede, en buena medida, de esa gigantesca operación estadística. Pero lo interesante de una cultura no siempre es lo probable. A veces es precisamente lo improbable. La cultura humana está llena de relleno, pero también está llena de obras irrepetibles.
Una máquina, en cambio, parece sentirse tentada estadísticamente hacia lo reconocible. Si la alimentación de los modelos se produce cada vez más a partir de contenidos generados artificialmente, existe el riesgo de que las siguientes generaciones aprendan una versión ya filtrada del mundo: una realidad suavizada por todas las máquinas anteriores.
El resultado no tendría por qué ser una catástrofe visible. Quizá no aparezca ningún día una pantalla anunciando que Internet ha dejado de ser humano. Sería –será– algo mucho más silencioso: Los textos comenzarán a parecerse ligeramente más entre sí, las imágenes repetirán determinadas composiciones, las metáforas se volverán familiares, las respuestas sonarán narcóticamente razonables. Cada generación sería un poco más parecida a la anterior.
El detalle interesante es que ya existe una palabra para describir buena parte de nuestra relación con este fenómeno: canibalismo digital. La imagen recuerda a ciertas mitologías del eterno retorno: una criatura que devora su propia cola y descubre que, al hacerlo, también está devorando el espacio que necesita para existir.
Hay, sin embargo, una diferencia importante entre esta metáfora y una profecía apocalíptica: el colapso de modelos no es inevitable. La investigación también ha mostrado que los datos sintéticos pueden utilizarse de manera eficaz cuando se combinan adecuadamente con datos reales y se controla su procedencia. El problema no es que una máquina escriba un texto, el problema es que olvidemos que lo ha escrito una máquina.
Quizá por eso en el futuro de la inteligencia artificial, una de las palabras más importantes no sea 'generación', sino 'origen': quién hizo esta imagen, de dónde procede este texto, qué parte de este conjunto de datos fue producida por seres humanos.
Tendemos a pensar que el gran problema de la inteligencia artificial consistirá en distinguir entre el ser humano y la máquina, pero tal vez el problema futuro sea otro: distinguir entre una máquina que ha aprendido de nosotros y una máquina cuyo aprendizaje de lo humano ha quedado tan en el pasado que ni tan siquiera sea capaz de recordarlo. ¿O quizás no sea eso un problema?
«Convertir locales en viviendas puede ser una vía interesante para generarlas sin construir un edificio»
Hipotecas 100% en septiembre: seis bancos llegan a financiar toda la tasación de tu vivienda
Soto Ivars, sobre el nuevo decreto de vivienda del Gobierno: «La izquierda lleva 8 años gobernando, pero del martes no pasa que salvan a Maricarmen»
Jorge Rey se adelanta a la Aemet y alerta del tiempo que hará en octubre en España, según las cabañuelas
Esta funcionalidad es exclusiva para usuarios registrados.
Canibalismo digital: cuando la IA empieza a soñar consigo misma
Canibalismo digital: cuando la IA empieza a soñar consigo misma