09.10.2026
El problema: ¿de quién son los datos que alimentan la IA?
El desarrollo de modelos de inteligencia artificial, en particular los grandes modelos generativos, requiere procesar cantidades masivas de texto, imágenes, vídeos y otros contenidos, gran parte de ellos protegidos por derechos de autor. Lo que hasta hace poco era una práctica silenciosa se ha convertido en el epicentro de la litigiosidad en propiedad intelectual: editoriales, medios de comunicación, artistas y titulares de bases de datos exigen saber si sus obras fueron utilizadas para entrenar sistemas de IA y si alguien obtuvo su consentimiento.
La tensión es clara: los desarrolladores argumentan que la extracción automatizada de datos (text and data mining o TDM) es necesaria para la innovación, los titulares responden que usar sus obras sin autorización sigue siendo una infracción. Los primeros pronunciamientos judiciales y regulatorios de 2024–2025 empiezan a trazar los límites.
Entrenar no es una sola conducta
El entrenamiento es una cadena de operaciones: se accede o adquiere el contenido, se descarga, ordena y depura para crear un dataset, se procesa durante el entrenamiento, parte de la información puede quedar representada o ser recuperable desde el modelo, y, finalmente, el sistema genera outputs. Cada fase puede tener una calificación jurídica distinta. Obtener una obra desde una fuente ilícita no equivale a analizar una copia obtenida legítimamente, del mismo modo que extraer patrones no es lo mismo que permitir que el modelo reproduzca fragmentos reconocibles.
La clave pasa a ser, por tanto, qué ocurrió con cada contenido, en qué fase y bajo qué título jurídico.
El marco europeo: excepciones de TDM, opt-out y Reglamento de IA
La Directiva sobre Derechos de Autor en el Mercado Único Digital (Directiva DSM 2019/790) introdujo dos excepciones para la minería de textos y datos: una para investigación científica (artículo 3) y otra de alcance general (artículo 4). Esta última permite determinadas reproducciones y extracciones sobre contenidos a los que se tenga acceso lícito, salvo que el titular haya reservado expresamente esos usos. En contenidos disponibles en internet, la reserva debe expresarse de forma adecuada, especialmente mediante medios legibles por máquina. España incorporó este régimen principalmente mediante el artículo 67 del Real Decreto-ley 24/2021.
Conviene evitar una simplificación frecuente: la ausencia de opt-out (opción de exclusión voluntaria) no convierte automáticamente en lícito cualquier uso de una obra para entrenar IA. Significa que determinadas copias o extracciones pueden quedar cubiertas por la excepción de TDM si se cumplen los demás requisitos. Siguen siendo relevantes el acceso lícito, las licencias, los derechos sobre bases de datos, las medidas tecnológicas de protección, los contratos y, cuando proceda, la protección de datos.
El Reglamento de Inteligencia Artificial (UE) 2024/1689 añade obligaciones específicas para los proveedores de modelos de IA de uso general (GPAI). Su artículo 53 exige adoptar una política de cumplimiento del derecho de autor de la UE, identificar y respetar las reservas de derechos y publicar un resumen suficientemente detallado del contenido utilizado para entrenar el modelo. Para los nuevos modelos, estas obligaciones se aplican desde el 2 de agosto de 2025 y, desde el 2 de agosto de 2026, la Comisión puede aplicar el régimen de multas previsto para los proveedores de GPAI. El marco se completa con el Código de Buenas Prácticas para GPAI, publicado en julio de 2025, de adhesión voluntaria.
¿Qué están diciendo los primeros tribunales?
En Estados Unidos, Thomson Reuters v. Ross Intelligence sigue siendo una referencia. En febrero de 2025, el Tribunal del Distrito de Delaware concluyó que Ross había infringido los derechos de Thomson Reuters al utilizar, sin licencia, resúmenes editoriales de Westlaw para desarrollar un motor de búsqueda jurídica competidor. La defensa de fair use fue rechazada atendiendo, entre otros factores, al carácter comercial, la escasa transformación y el impacto sobre el mercado potencial de licencias. Cuando el producto entrenado compite directamente con la fuente de los datos, el riesgo aumenta.
En Europa, los casos recientes muestran por qué es esencial separar las fases. En LAION, el tribunal superior de Hamburgo confirmó en diciembre de 2025 una decisión favorable a la entidad que había descargado una imagen para comprobar su correspondencia con una descripción y construir un dataset de pares imagen-texto1. Entendió que esa operación podía quedar cubierta por la excepción alemana de TDM y consideró insuficiente, en aquel caso, la reserva de derechos invocada. La sentencia no declaró lícito cualquier entrenamiento comercial: analizó una fase anterior, la creación y depuración del dataset. A 9 de septiembre de 2026, el asunto está pendiente ante el Bundesgerichtshof.
En GEMA v. OpenAI, el Landgericht München I consideró en noviembre de 2025 que determinadas letras de canciones podían recuperarse mediante outputs muy próximos a los textos originales y trató esa “memorización” como una forma de reproducción. La resolución distinguió entre las copias técnicas del procesamiento, la eventual permanencia reproducible de la obra en el modelo y los outputs. La sentencia no es firme.
La cuestión prejudicial C-250/25, Like Company v. Google Ireland, puede resultar aún más decisiva. El Tribunal de Justicia de la Unión Europea debe pronunciarse, entre otros extremos, sobre si utilizar material protegido para entrenar un gran modelo de lenguaje constituye una reproducción y si puede acogerse a la excepción general de TDM del artículo 4 de la Directiva DSM. A 9 de septiembre de 2026 el asunto sigue pendiente.
Comparativa UE–EE. UU.: dos caminos, riesgos compartidos
La UE dispone de excepciones legales específicas para TDM, sujetas a requisitos y, en el artículo 4, a la posibilidad de reserva por el titular. Estados Unidos carece de una excepción equivalente y somete cada caso al análisis multifactorial del fair use. La U.S. Copyright Office, en la tercera parte de su informe sobre IA generativa y copyright publicada en mayo de 2025, también evita reglas absolutas y destaca factores como la finalidad del uso, el origen de las copias, el efecto sobre el mercado y la existencia de mercados de licencias.
Pese a las diferencias, ambos sistemas convergen en preguntas similares: ¿de dónde salió la obra?, ¿qué copia se hizo?, ¿para qué?, ¿qué quedó en el modelo? y ¿qué puede reaparecer en el output? Para operadores internacionales, un mismo corpus puede superar el análisis de una fase o jurisdicción y generar problemas en otra.
Implicaciones prácticas para cada actor
- Desarrolladores de modelos de IA: documentar la procedencia de cada conjunto de datos, implementar sistemas de detección de reservas de derechos y conservar evidencia de las licencias obtenidas.
- Plataformas que integran modelos de terceros: exigir garantías contractuales sobre la licitud del entrenamiento y prever cláusulas de indemnización frente a reclamaciones de propiedad intelectual.
- Editoriales y medios de comunicación: implementar reservas de derechos técnicas y jurídicas (robots.txt, metadatos, condiciones de uso) y establecer programas de licenciamiento para usos de IA.
- Titulares de grandes catálogos (bases de datos, archivos): auditar si sus contenidos están siendo utilizados sin autorización y activar los mecanismos de exclusión voluntaria (opt-out) disponibles.
- Empresas de extracción de datos (scraping) y proveedores de datasets: verificar que los datos suministrados respetan las reservas de derechos vigentes y que su obtención no implica elusión de medidas de protección.
El panorama regulatorio avanza con rapidez, pero una cosa es segura: la época del entrenamiento masivo sin control ha terminado. Tanto desarrolladores como titulares de derechos necesitan asesoramiento especializado para navegar un entorno en el que las decisiones técnicas tienen consecuencias legales inmediatas.
Alba Terés | Departamento IA-Gobernanza Digital