Verificada a 27 de septiembre de 2026. Si algún dato ha cambiado, avísame y la actualizo con la fecha del cambio.
Si publicas obra en internet, el derecho europeo permite reservar determinados usos para minería de textos y datos. Esa minería puede intervenir en la preparación de conjuntos de datos y en algunas fases del desarrollo de sistemas de inteligencia artificial. La reserva no es un candado: expresa jurídicamente una oposición que los sistemas conformes deben poder detectar.
Esta guía explica la base legal, las señales disponibles y sus límites. No es asesoramiento jurídico. Antes de modificar un sitio en producción, comprueba su configuración y conserva una copia.
La base legal
El artículo 4 de la Directiva (UE) 2019/790 permite realizar reproducciones y extracciones para minería de textos y datos sobre obras accesibles lícitamente, siempre que el titular no haya reservado expresamente esos usos de manera adecuada. Cuando el contenido está disponible públicamente en internet, la reserva debe expresarse por medios de lectura mecánica.
La directiva no impone un protocolo único. El considerando 18 menciona como ejemplos los medios de lectura mecánica, incluidos los metadatos y las condiciones de un sitio o servicio. La eficacia de una señal concreta dependerá de que exprese la reserva, resulte detectable en el contexto correspondiente y pueda vincularse con quien está legitimado para formularla.
La reserva del artículo 4 no excluye la excepción separada del artículo 3 para organismos de investigación e instituciones responsables del patrimonio cultural que realizan minería con fines de investigación científica sobre materiales a los que tienen acceso lícito. Tampoco revoca licencias ya concedidas ni borra copias obtenidas antes de la reserva.
Qué enseñó Kneschke contra LAION
El Tribunal Superior Regional de Hamburgo resolvió el 10 de diciembre de 2025 que la descarga temporal de una fotografía durante la creación de un conjunto de datos podía quedar amparada por las excepciones alemanas de minería. La agencia que alojaba la imagen había incluido una prohibición en lenguaje natural. El tribunal no afirmó que toda cláusula escrita sea inútil por principio: consideró que, para el momento relevante de 2021, no se había acreditado que esa reserva fuera legible por máquina en el sentido exigido para contenido disponible en línea.
La resolución está recurrida. El Bundesgerichtshof celebró la vista el 3 de septiembre de 2026 y ha señalado el pronunciamiento para el 17 de diciembre de 2026. Hasta entonces, el caso no debe presentarse como cierre definitivo del debate europeo.
La enseñanza práctica es limitada pero importante: un aviso jurídico legible por personas puede no bastar por sí solo. Conviene acompañarlo de señales técnicas coherentes y conservar pruebas de cuándo estaban activas.
Señales en capas
No existe una herramienta que, por sí sola, impida todos los usos. La opción más prudente es combinar una reserva jurídica clara con mecanismos técnicos adecuados al lugar donde publicas.
1. robots.txt
robots.txt es un archivo situado en la raíz del dominio que indica a rastreadores conformes qué rutas pueden visitar. Cada operador publica los identificadores que utiliza y puede separar el rastreo para entrenamiento, búsqueda o acciones iniciadas por usuarios.
Un ejemplo orientativo para bloquear cuatro identificadores vinculados al entrenamiento o a grandes corpus es:
User-agent: GPTBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: CCBot
Disallow: /
Comprueba siempre los nombres en la documentación actual de cada operador antes de publicar el archivo.
GPTBotes el identificador de OpenAI para rastreo que puede contribuir al desarrollo de modelos generativos.Google-Extendedes un token de control, no un rastreador HTTP independiente. Permite limitar determinados usos de IA de Google sin bloquear la indexación ordinaria de Google Search.ClaudeBotes el rastreador de Anthropic para contenido que podría contribuir al entrenamiento.CCBotes el rastreador de Common Crawl, cuyo corpus abierto puede ser reutilizado por terceros.
No bloquees por error los identificadores de búsqueda si quieres que los asistentes puedan encontrar y enlazar tus páginas. OAI-SearchBot y Claude-SearchBot, por ejemplo, cumplen una función distinta de los rastreadores de entrenamiento.
robots.txt no impide técnicamente el acceso. Da instrucciones a rastreadores que deciden respetarlas. Tampoco controla copias de tu obra alojadas en otros dominios.
2. TDMRep
El TDM Reservation Protocol está diseñado específicamente para expresar reservas relativas a la minería. Fue publicado el 10 de mayo de 2024 como informe final de un grupo comunitario del W3C. No es un estándar del W3C ni forma parte de su itinerario oficial de estándares.
TDMRep permite transportar la señal mediante:
/.well-known/tdmrep.jsonen el servidor;- la cabecera HTTP
TDM-Reservation; - metadatos HTML;
- metadatos en EPUB y PDF.
En HTML, la declaración mínima es:
<meta name="tdm-reservation" content="1">
El valor 1 significa que los derechos de minería están reservados. Puede añadirse una política que explique cómo solicitar una licencia:
<meta name="tdm-reservation" content="1">
<meta name="tdm-policy" content="https://ejemplo.com/licencias-tdm.json">
Para una política global en el servidor, la sintaxis exacta del archivo JSON debe seguir el informe vigente. No improvises su estructura: una etiqueta HTML válida es preferible a un archivo mal formado.
TDMRep expresa una política, no un control de acceso. Solo produce efectos técnicos frente a sistemas que lo leen y lo procesan.
3. Aserción de entrenamiento y minería de CAWG
El Creator Assertions Working Group publicó la versión 1.1 de su aserción de entrenamiento y minería el 16 de mayo de 2025. Permite que una persona incorpore a un manifiesto C2PA información sobre usos permitidos o restringidos para minería y entrenamiento.
La distinción institucional importa. C2PA aclaró el 22 de enero de 2026 que su especificación central no contiene una aserción estándar sobre minería ni una tecnología de gestión de derechos. La aserción procede de CAWG y puede transportarse mediante la arquitectura extensible de los manifiestos C2PA.
Su ventaja es que la señal acompaña al archivo. Su debilidad es la persistencia: puede perderse si una plataforma elimina metadatos, genera una copia nueva o no conserva el manifiesto. Comprueba el archivo después de cada subida y descarga.
4. ai.txt, noai y noimageai
ai.txt es una propuesta privada vinculada a Spawning. noai y noimageai son convenciones utilizadas por algunas plataformas y comunidades creativas. No son estándares jurídicos o técnicos universalmente adoptados y no he localizado jurisprudencia que les reconozca por sí solos eficacia como reserva del artículo 4.
Pueden reforzar la prueba de una voluntad constante, pero no deberían ser tu única señal cuando controlas el dominio y puedes utilizar mecanismos más específicos.
Una cláusula legible por personas
Añade también una declaración clara a tus condiciones o aviso de derechos. Por ejemplo:
El titular reserva expresamente los usos de las obras y contenidos de este sitio para minería de textos y datos, incluido su uso en conjuntos de datos y procesos de entrenamiento, ajuste o evaluación de sistemas de inteligencia artificial, conforme al artículo 4.3 de la Directiva (UE) 2019/790 y a su transposición aplicable. Esta reserva no afecta a los usos autorizados mediante licencia ni a las excepciones legales que no admiten reserva.
Adapta la cláusula a los derechos que realmente controlas. No reserves en nombre de fotógrafos, colaboradores o titulares distintos sin autorización. Una cláusula más amplia no sustituye una señal técnica legible por máquina.
Si publicas en plataformas ajenas
En una red social, agencia, galería, repositorio o tienda no controlas normalmente el robots.txt, las cabeceras HTTP ni la conservación de metadatos. La reserva de tu web solo alcanza el contenido servido desde tu dominio; no gobierna automáticamente las copias alojadas por terceros.
Antes de publicar, revisa:
- las condiciones de licencia concedida a la plataforma;
- su política sobre entrenamiento y minería;
- si ofrece una opción de exclusión;
- si conserva Content Credentials y otros metadatos;
- si permite enlazar o incrustar desde tu dominio en lugar de volver a subir el archivo.
Mantén en tu web una copia canónica con identificador, fecha y reserva. Esto no controla las demás copias, pero mejora la trazabilidad.
Cómo conservar prueba
La reserva no suele tener efecto retroactivo. Para acreditar desde cuándo estaba activa:
- guarda copias fechadas de
robots.txt, del HTML y de cualquier archivo TDMRep; - conserva registros de despliegue, historial de versiones o recibos del proveedor;
- captura la respuesta HTTP completa cuando uses cabeceras;
- verifica periódicamente que el sitio público muestra la señal;
- conserva los archivos originales con sus manifiestos y metadatos;
- archiva las condiciones aplicables de las plataformas que utilizas.
Un archivo web externo puede aportar contexto, pero no garantiza que capture cabeceras, archivos restringidos o metadatos incrustados. No dependas de una sola prueba.
Qué no garantiza ninguna reserva
Ninguna de estas medidas:
- impide a un actor incumplidor descargar el contenido;
- elimina copias anteriores ni conjuntos ya construidos;
- obliga a retirar una obra alojada por un tercero;
- demuestra por sí sola que una obra fue utilizada para entrenar un modelo;
- excluye la minería científica amparada por el artículo 3;
- sustituye una reclamación, una licencia o una medida técnica de control de acceso;
- resuelve qué ley se aplica cuando los actos ocurren en varios países.
Una reserva mejora la señal jurídica y documental. No asegura la exclusión material.
Qué hacer hoy
- Identifica qué derechos controlas y en qué dominios está alojada la obra.
- Separa rastreo de entrenamiento, búsqueda y acceso iniciado por usuarios.
- Configura
robots.txtcon los identificadores actuales que quieras excluir. - Añade TDMRep mediante HTML, cabecera o archivo bien formado.
- Publica una cláusula jurídica coherente con las señales técnicas.
- Incorpora la aserción de CAWG cuando tu flujo conserve manifiestos C2PA.
- Revisa las condiciones de las plataformas externas.
- Conserva pruebas fechadas y comprueba periódicamente la configuración.
Sobre la conversación abierta
Esta guía parte de la Directiva 2019/790, el Código de buenas prácticas para modelos de IA de propósito general, TDMRep, la documentación de CAWG y C2PA y la resolución de Hamburgo en Kneschke contra LAION. El mapa técnico seguirá cambiando. Debe revisarse tras el pronunciamiento alemán previsto para el 17 de diciembre de 2026 y cuando existan nuevas soluciones reconocidas o criterios judiciales.
Fuentes
- Directiva (UE) 2019/790, arts. 3 y 4 y considerando 18.
- Comisión Europea, Código de buenas prácticas para modelos de IA de propósito general.
- W3C TDM Reservation Protocol Community Group, informe final de TDMRep, 10 de mayo de 2024.
- Creator Assertions Working Group, Training and Data Mining Assertion v1.1.
- C2PA, aclaración sobre las aserciones TDM, 22 de enero de 2026.
- Bundesgerichtshof, I ZR 281/25, pronunciamiento señalado para el 17 de diciembre de 2026.
- Hanseatisches Oberlandesgericht Hamburg, 5 U 104/24, 10 de diciembre de 2025.
- OpenAI, documentación de rastreadores.
- Anthropic, documentación de rastreadores.
- Google, Google-Extended.
- Common Crawl, CCBot.
