Ilustración monumental en tonos papiro cálido y grafito, con estética poligonal de piedra tallada, vista en perspectiva aérea oblicua. Una vasta llanura se cubre, hasta el horizonte, de muchos asentamientos humanos de piedra facetada, todos de igual factura: racimos de viviendas, terrazas, árboles y pequeñas calles, cada uno entero y labrado con el mismo cuidado, repartidos por igual sobre toda la tierra. Pero solo uno de ellos, descentrado, queda bajo un único haz de luz cálida que cae desde una abertura sobre él: sus tejados, árboles y calles poligonales aparecen iluminados, legibles, vivos. Todos los demás asentamientos, mucho más numerosos, se extienden por el resto de la llanura en penumbra uniforme, completos, habitados, tallados con el mismo esmero, pero sin luz, sin alcanzar, oscuros hasta el horizonte. Todos son iguales en su hechura; solo se ve el que queda bajo la luz. El tono es grave y sereno.

Cuaderno público

Quién puede ser visto

En 2017 unos investigadores intentaron algo simple: averiguar de dónde venían las fotografías con que se entrenaban los sistemas de reconocimiento de imágenes. Tomaron ImageNet, uno de los conjuntos de datos que marcaron el desarrollo de la visión artificial contemporánea, y miraron, en las imágenes cuyo origen podían rastrear, qué país había puesto la cámara. Cuarenta y cinco de cada cien procedían de Estados Unidos; de China, una; de India, dos.

En otro conjunto del mismo estudio, Open Images, seis países de Norteamérica y Europa reunían el sesenta por ciento de las imágenes localizables. Casi una década después, en 2026, una auditoría de los grandes corpus con que se entrenan hoy los modelos generativos, los que producen imágenes a partir de texto, encontró lo mismo con otros nombres: Estados Unidos, Reino Unido y Canadá aportaban el cuarenta y ocho por ciento de las muestras examinadas; África, el tres coma ocho; Sudamérica, el uno coma ocho. La representación de cada país corría casi en paralelo a su producto interior bruto.

Ninguna es una geolocalización completa de todas las imágenes: son proporciones dentro del subconjunto que los investigadores pudieron rastrear. No dicen «el cuarenta y cinco por ciento de todo ImageNet es estadounidense», dicen «de las imágenes cuyo origen se pudo determinar». La salvedad importa. Pero incluso con ella, el patrón es inequívoco y se repite en cada conjunto medido, de 2011 a 2026, con distintos métodos: el ojo con que las máquinas aprenden a ver el mundo mira, sobre todo, desde el Norte.

Un tópico frecuente lo trata como un problema de representación: faltan imágenes del Sur, hay que añadirlas, equilibrar el conjunto. Es verdad y es insuficiente, porque supone que el asunto se arregla metiendo más fotos. Otro tópico lo lee como una cuestión de contenido: los modelos tienen prejuicios, reproducen estereotipos. También es cierto, y está medido: cuando se le pide a un generador una escena de África o del Sudeste Asiático, un estudio revisado por pares de 2024 encontró que devuelve con frecuencia infraestructura rudimentaria, herramientas asociadas a bajos ingresos y escenarios rurales exagerados, ausentes o mucho menos frecuentes en el conjunto de fotografías reales utilizado como referencia. La máquina no describe el lugar: repite una caricatura del lugar.

Hay que separar dos preguntas que casi siempre se dan juntas:

La primera: qué hace que una imagen sea algo más que un archivo, que sea un acontecimiento, que reorganice cómo alguien ve. Esa pregunta no tiene geografía. Una fotografía tomada en un pueblo de Malí puede portar tanta carga, tanta capacidad de reordenar la mirada de quien la encuentra, como una tomada en Nueva York. Lo que una imagen es capaz de hacer no depende de dónde se hizo. En eso el Sur y el Norte están exactamente igualados: la potencia de una imagen es relacional, se activa en el encuentro entre la imagen y quien la mira, y ese encuentro puede darse en cualquier parte.

La segunda pregunta es distinta, y es la que las cifras responden: cuáles de esas imágenes llegan a encontrarse con alguien. Para que una imagen se active como acontecimiento hace falta que exista un observador en condiciones de recibirla, y que exista un observador no es un dato natural: es una construcción material. Hacen falta archivos que la guarden, plataformas que la muestren, buscadores que la encuentren, modelos que la hayan visto, museos que la expongan, crítica que la nombre. Todo eso, que parece el escenario neutro donde ocurre el arte, es en realidad su condición de posibilidad. Y todo eso está concentrado geográficamente con la misma desigualdad que las cifras de los datasets.

La desigualdad Norte-Sur no altera lo que una imagen del Sur es capaz de hacer; su potencia sigue intacta, esperando. Lo que la desigualdad decide es cuáles de esas potencias llegan a activarse y cuáles se quedan como posibilidad no cumplida, porque nunca hubo la infraestructura que pusiera esa imagen delante de un observador. No es que el Sur produzca imágenes menores. Es que produce imágenes que, en una proporción abrumadora, no llegan a ser vistas por el aparato que decide qué cuenta.

La injusticia, así, no es estética ni de contenido sino de infraestructura de actualización. No se corrige diciendo que las imágenes del Sur son igual de valiosas, cosa que es verdad y no cambia nada. Se corrige, si acaso, cambiando quién posee los archivos, quién entrena los modelos, dónde está el cómputo, qué idiomas indexan las plataformas. Un dato lo ilustra con crudeza: en uno de esos corpus, las referencias a Sudamérica son el veintiséis por ciento cuando el texto que acompaña a la imagen está en español, y caen al uno coma ocho por ciento cuando está en inglés. La misma región, la misma realidad, aparece o desaparece según la lengua del pie de foto. No es que Sudamérica produzca menos imágenes sino que el aparato que las procesa lee, sobre todo, en inglés.

Cada vez que un sistema nos devuelve «el mundo», una imagen genérica de una calle, de una casa, de una persona, hay que preguntar desde dónde está viendo: qué observador se ha construido para que esa imagen, y no otra, aparezca por defecto. La imagen que se presenta como universal es siempre una imagen situada que ha logrado, por infraestructura y no por mérito, pasar por universal.

Lo que ninguna de estas máquinas produce es una mirada de ningún sitio. Producen la mirada del sitio que pudo permitirse construir el aparato de mirar. Y mientras ese aparato siga concentrado donde está, seguirá habiendo imágenes con toda la potencia del mundo que no le ocurren a nadie, no porque no valgan, sino porque no hubo quien pudiera verlas.

Sobre la conversación abierta

Este texto separa dos preguntas que suelen confundirse: qué hace que una imagen sea un acontecimiento, que es relacional y no tiene geografía, y qué decide cuáles imágenes llegan a activarse como tal, que es infraestructural y está distribuido de forma desigual entre Norte y Sur. Los datos proceden de estudios sobre la composición geográfica de los conjuntos con que se entrenan los sistemas de visión y de generación de imágenes (ImageNet y Open Images en 2017; Re-LAION, DataComp-1B y Conceptual Captions en 2026), citados con su restricción metodológica: son proporciones de los subconjuntos geolocalizables, no censos completos. Continúa la línea que abrí en «Quién entrena el mundo» sobre la dimensión geográfica del poder cultural. Si alguien quiere intervenir desde los estudios visuales, la crítica de datasets o la economía política de la infraestructura, este cuaderno sigue abierto.

Fuentes

Shankar, Halpern, Breck, Atwood, Wilson y Sculley, «No Classification without Representation: Assessing Geodiversity Issues in Open Data Sets for the Developing World», arXiv:1711.08536, workshop Machine Learning for the Developing World (NIPS 2017). En el subconjunto geolocalizable de la versión de ImageNet de 2011, ~45 % de las imágenes se atribuyó a Estados Unidos, 1 % a China y 2,1 % a India; en Open Images, más del 32 % a Estados Unidos y el 60 % a los seis países más representados de Norteamérica y Europa.

Basu et al., «Where Do Images Come From? Analyzing Captions to Geographically Profile Datasets», arXiv:2602.09775 (preprint, febrero de 2026). En los captions geolocalizables de veinte entidades frecuentes de Re-LAION, DataComp-1B y Conceptual Captions, el 48,0 % de las muestras se atribuyó a Estados Unidos, Reino Unido y Canadá, el 3,8 % a África y el 1,8 % a Sudamérica; correlación entre representación y PIB de ρ = 0,82; en Re-LAION, quince países reúnen el 77,2 % de los captions localizados, y la referencia a Sudamérica pasa del 26,4 % en captions en español al 1,8 % en inglés.

Hall et al., «Towards Geographic Inclusion in the Evaluation of Text-to-Image Models», ACM FAccT 2024, DOI 10.1145/3630106.3658927. Las imágenes generadas para África y el Sudeste Asiático incorporan con frecuencia infraestructura rudimentaria, herramientas de bajos ingresos y escenarios rurales exagerados ausentes del dataset real de referencia.

Todos los porcentajes citados corresponden a los subconjuntos geolocalizables analizados en cada estudio, no a una geolocalización exhaustiva de la totalidad de cada dataset, y ninguno de los estudios afirma una relación causal directa entre la composición del dataset y el output de los modelos generativos.


Descubre más desde Juan A. Esteban

Suscríbete y recibe las últimas entradas en tu correo electrónico.

Español English (UK)