Síguenos

Tecnología

¿La IA usa libros sin permiso? La denuncia de autores

Publicado

el

La IA usa libros sin permiso

La denuncia de más de 200 escritores destapa cómo la IA usa libros sin permiso, qué significa expolio y por qué el conflicto crece sin freno.

Más de 200 escritores españoles han dado un paso que ya no suena a protesta retórica, sino a choque frontal con la industria tecnológica. Este 4 de marzo de 2026, en el Círculo de Bellas Artes de Madrid, la Conferencia de Asociaciones de Escritoras y Escritores, que reúne a 14 entidades y dice representar a más de 9.000 autores, presentó un manifiesto en el que denuncia el “expolio” de sus obras por la inteligencia artificial generativa y exige un modelo justo y sostenible. Entre los firmantes aparecen Luis Mateo Díez, Antonio Gamoneda, José María Merino, Rosa Montero, Carme Riera, Ana Merino, Lorenzo Silva, Julia Navarro, Javier Sierra, Clara Sánchez, Ana Rossetti o Fanny Rubio. No es una pataleta de nicho. Es una señal de alarma desde el centro mismo de la literatura española.

Cuando esos autores hablan de expolio, están diciendo algo muy concreto: que sus libros habrían servido para alimentar sistemas de IA sin permiso, sin pago y, muchas veces, sin que ni siquiera exista una explicación clara sobre qué obras se usaron, cómo se consiguieron y para qué productos comerciales acabaron sirviendo. El término tiene un peso fuerte en castellano porque remite a despojo, a una apropiación injusta de algo valioso. En este caso no se denuncia que una máquina “lea” como lee una persona, sino que empresas enteras puedan extraer valor económico de bibliotecas ajenas para entrenar modelos capaces de resumir, imitar, traducir, corregir o generar textos que luego compiten en el mismo mercado cultural. Ahí está el nervio real del conflicto.

Un manifiesto con nombres propios y una exigencia muy precisa

El documento presentado en Madrid lleva un título sobrio, “Manifiesto por una IAG sostenible”, pero el contenido no tiene nada de tibio. La tesis central es que muchas empresas de inteligencia artificial generativa han usado obras protegidas por derechos de autor de forma no autorizada ni remunerada. Manuel Rico, portavoz de la Conferencia y presidente de la Asociación Colegial de Escritoras y Escritores de España, lo resumió con una frase que marca la línea de todo el texto: la IA generativa, vino a decir, no puede construirse a costa de expoliar a los creadores. La idea es sencilla de entender y muy difícil de resolver: si el combustible del sistema son textos ajenos, alguien tiene que responder por ese uso.

La reclamación principal se condensa en tres palabras que el sector lleva meses repitiendo casi como un estribillo jurídico: autorización, remuneración y transparencia. No quieren solo dinero. Quieren saber qué se ha usado, quién lo ha usado y bajo qué cobertura legal. También exigen que las administraciones no compren ni utilicen programas de IA generativa desarrollados al margen de los derechos de autor o de la privacidad. Y aquí asoma una derivada muy española: el enfado no va solo contra las grandes tecnológicas estadounidenses. También apunta a los poderes públicos, a los proyectos nacionales de IA y a cualquier intento de normalizar el entrenamiento masivo con obras protegidas sin un sistema claro de control y compensación.

Carme Riera, escritora, vicedirectora de la RAE y presidenta de CEDRO, puso otra pieza clave sobre la mesa: el marco legislativo actual, dijo, ya no basta. Su mensaje no fue antitecnológico. De hecho, la idea de fondo del manifiesto no consiste en frenar la IA, sino en impedir que la innovación se levante sobre una zona gris permanente. Ese matiz importa. Los firmantes no dicen que toda IA sea ilegítima; dicen que una parte del negocio actual se ha construido con una mezcla muy incómoda de opacidad, asimetría de poder y aprovechamiento de obras ajenas.

Qué significa aquí “expolio” y por qué no es una exageración vacía

En lenguaje corriente, expoliar es despojar a alguien de algo con injusticia. La palabra tiene una temperatura moral más alta que “uso indebido” o “aprovechamiento irregular”, claro, pero no cae del cielo. Si una empresa copia o extrae texto de miles o millones de libros, los procesa para entrenar un modelo y después vende servicios que se apoyan en ese entrenamiento, los autores entienden que ahí hay un traslado de valor desde la obra original hacia un producto nuevo del que ellos han quedado fuera. No es solo una cuestión sentimental. Es una discusión sobre propiedad intelectual, licencia, trazabilidad y reparto de ingresos.

El conflicto se vuelve todavía más áspero porque el libro no desaparece del estante cuando se usa para entrenar una IA. Y justamente por eso resulta más fácil que desde fuera se minimice el problema. No hay una caja fuerte reventada ni una librería vacía. Lo que hay es algo más escurridizo: una captura masiva de contenido que termina incrustada en parámetros matemáticos, en modelos estadísticos y en servicios comerciales capaces de producir texto a una velocidad industrial. El autor conserva su novela, sí, pero puede haber perdido otra cosa: control sobre el uso, capacidad de negociación y parte del valor económico derivado de su trabajo.

Por eso el sector habla de expolio y no solo de infracción. Porque entiende que el daño no se limita a una copia puntual. Se parece más a una extracción a gran escala. Como si una cantera privada encontrara una veta bajo una montaña ajena, sacara toneladas de piedra durante la noche y luego discutiera en público si realmente aquello era piedra, si el terreno estaba bien señalizado o si la excavación había sido lo bastante transformadora como para considerarse otra cosa. El lenguaje puede molestar, pero el enfado tiene una lógica bastante visible.

No se denuncia solo una copia: se denuncia una cadena de negocio

Lo que de verdad irrita a los escritores es la cadena completa. Primero se recopilan textos. Después se limpian, se fragmentan, se convierten en datos legibles por máquina y se usan para ajustar el modelo. Más tarde, ese modelo se integra en chatbots, asistentes, herramientas de escritura, motores de búsqueda, correctores, traductores o sistemas de productividad que sí generan ingresos o consolidan poder de mercado. En ese recorrido, el libro original puede quedar reducido a una pieza diminuta del engranaje, pero sin miles y miles de piezas así el engranaje no funciona igual. Esa es la tesis de fondo: aunque una obra no sea reconocible línea por línea en la salida final, ha podido ser útil, rentable y decisiva en el aprendizaje del sistema.

Cómo entra un libro en el estómago de una IA

La parte técnica, contada sin humo, funciona más o menos así. Un modelo lingüístico de gran tamaño necesita cantidades gigantescas de texto para aprender patrones: sintaxis, vocabulario, tono, relaciones entre palabras, estructura narrativa, fórmulas de resumen, convenciones de género, información factual. Para eso se recurre a corpus inmensos que mezclan páginas web, foros, artículos, bases de datos, código y también libros. Los libros interesan muchísimo porque son texto largo, relativamente limpio, con una estructura cuidada, buena puntuación y una densidad léxica que no se encuentra con la misma facilidad en otras fuentes.

El problema aparece cuando ese material procede de lugares dudosos o directamente ilícitos. En los últimos dos años se han multiplicado las denuncias sobre el uso de bibliotecas pirata y grandes repositorios de libros digitalizados sin autorización, como LibGen o el conjunto conocido como Books3, que durante mucho tiempo circularon como recursos valiosos para entrenar modelos. Ahí la controversia se vuelve menos abstracta y más desagradable. Ya no se trata de una discusión teórica sobre si “aprender” de una obra vulnera o no el derecho de autor, sino de una pregunta muy pedestre: ¿de dónde salió exactamente ese libro y con qué permiso entró en la cocina del modelo?

Si la respuesta es que el libro venía de una compra legítima, de un acuerdo de licencia o de un repositorio autorizado, la discusión legal sigue existiendo, pero cambia de tono. Si la respuesta es que venía de una shadow library, de una web pirata o de un dataset construido con archivos obtenidos sin autorización, la base moral y jurídica de la defensa se estrecha muchísimo. Por eso los autores insisten tanto en la palabra transparencia. Sin transparencia, todo queda en una niebla comodísima para quien entrenó el sistema y desesperante para quien sospecha que su trabajo está ahí dentro.

Una vez dentro del proceso, el texto no permanece como un libro reconocible. Se trocea, se tokeniza, se convierte en unidades manejables y entra en ciclos de entrenamiento donde el modelo va ajustando probabilidades. En esa fase el contenido deja de verse como un capítulo o como una voz de autor y pasa a ser señal estadística. Es precisamente esa transformación la que algunas tecnológicas usan para defender que no están “copiando” en un sentido tradicional. Pero para muchos autores esa objeción no basta: que el libro se haya deshecho en átomos matemáticos no cambia el hecho de que sin ese libro el sistema habría aprendido menos o peor.

El gran nudo legal europeo

Aquí el asunto se complica. En la Unión Europea existe desde 2019 una excepción para la minería de textos y datos, la famosa TDM por sus siglas en inglés. Esa directiva abrió la puerta a determinadas reproducciones y extracciones automatizadas de contenido digital para analizar textos y datos. En uno de sus artículos, además, permite usos más amplios —también comerciales— siempre que el titular de derechos no haya reservado expresamente ese uso y siempre que exista acceso lícito al material. Dicho de forma menos notarial: en Europa hay una ventana legal para analizar grandes masas de contenido, pero esa ventana no equivale a un salvoconducto universal.

Ahí chocan dos mundos. Las empresas tecnológicas leen esa excepción como una base importante para entrenar sistemas con grandes cantidades de contenido. Los autores y buena parte del sector cultural contestan que la excepción se diseñó antes del auge de la IA generativa actual y que no puede usarse como barra libre para absorber obras protegidas a escala industrial. Añaden, además, dos objeciones muy serias. La primera: si el acceso al material no fue lícito, la excepción no vale. La segunda: incluso cuando exista un mecanismo de reserva de derechos u opt-out, en la práctica resulta dificilísimo saber si una empresa lo ha respetado porque los datasets y los recorridos de los datos son opacos.

La nueva AI Act europea tampoco zanja por sí sola la pelea, aunque sí aprieta algunas tuercas. Desde el 2 de agosto de 2025, las obligaciones para los proveedores de modelos de IA de propósito general incluyen implantar una política de cumplimiento en materia de copyright y publicar un resumen del contenido usado para entrenar el modelo. Eso suena bien sobre el papel, pero no resuelve el gran enfado de los creadores: muchos consideran que esos resúmenes son todavía demasiado generales, que llegan tarde respecto al material ya utilizado y que no sustituyen ni la autorización previa ni una remuneración clara. En otras palabras, la ley empieza a iluminar el cuarto, pero todavía no enseña cada caja.

Ese es el matiz que más veces se pierde en el debate público. Una empresa puede verse obligada a resumir de dónde proceden sus datos de entrenamiento y, aun así, no haber pedido permiso a cada titular o no haber pactado una compensación aceptable. La transparencia es necesaria, desde luego, pero no arregla por sí sola la discusión sobre el derecho a autorizar ni el derecho a cobrar. Para los firmantes del manifiesto, un modelo justo exige las tres piezas juntas: autorización, remuneración y transparencia. Si falta una, el edificio queda cojo.

De los tribunales extranjeros al choque español

La alarma española no ha brotado en un vacío. En Estados Unidos y Francia ya se han abierto frentes judiciales muy visibles. En territorio estadounidense, los pleitos contra Meta y Anthropic han sacado a la luz la discusión sobre si entrenar modelos con libros protegidos puede considerarse un uso transformador y, sobre todo, si el modo de conseguir esos libros —incluyendo descargas desde repositorios pirata— abre una vía clara de responsabilidad. El caso de Anthropic acabó en 2025 con un acuerdo millonario aprobado judicialmente, después de que la disputa girara alrededor de cientos de miles de libros presuntamente pirateados para entrenar chatbots. En Francia, varias asociaciones de autores y editores llevaron a Meta a los tribunales por el uso no autorizado de obras protegidas para entrenar IA generativa.

Estas batallas importan mucho en España porque enseñan dos cosas a la vez. La primera, que la controversia no es imaginaria: hay ya litigios reales, jueces, acuerdos, demandas y documentos internos. La segunda, que el terreno sigue siendo movedizo. En algunos fallos estadounidenses se ha distinguido entre el entrenamiento en sí y la forma de adquisición de los libros, como si una parte del proceso pudiera considerarse transformadora mientras la otra siguiera oliendo a piratería. Esa grieta jurídica es justo lo que inquieta al sector editorial europeo. Nadie quiere que se consolide una especie de doctrina práctica según la cual usar obras ajenas sale rentable aunque después, si acaso, se negocie una compensación tardía.

En paralelo, la aparición de buscadores y bases públicas que permitían comprobar si ciertos títulos figuraban en catálogos usados por sistemas de IA hizo que muchos autores vieran el problema con una nitidez nueva. De repente ya no hablaban de una amenaza difusa, sino de sus libros, con nombre y apellido, flotando en depósitos ajenos. Ese cambio psicológico ha sido enorme. La discusión dejó de ser teórica y empezó a tener una forma muy física, casi doméstica: el libro estaba ahí, y nadie había pedido nada.

La denuncia de este miércoles también puso el foco en los traductores, un colectivo que lleva tiempo avisando de un golpe doble. Amaya García Gallego, presidenta de la sección de traductores de ACE, sostuvo que la IA generativa no solo expolia obra ya publicada, sino que algunas editoriales empiezan a usarla también como herramienta de presión laboral. La idea es áspera y muy concreta: si una empresa dispone de corpus enormes de traducciones previas y de herramientas capaces de imitarlas o de abaratar procesos, la tentación de rebajar tarifas, acelerar plazos o sustituir parte del trabajo humano crece enseguida.

Aquí el conflicto ya no se limita al libro que entra en el entrenamiento, sino al empleo que sale por la ventana. En edición, corrección y traducción, la IA se presenta muchas veces como un apoyo. A veces lo es. Pero el sector teme que el ahorro de costes se construya utilizando sin licencia las obras que dieron forma a esa misma herramienta. Es decir, el profesional podría verse desplazado por un sistema entrenado, en parte, con su propio trabajo previo. La imagen tiene algo de ironía negra: primero te absorben la voz; luego te la venden como sustituto barato.

El malestar no empezó esta semana. Ya en enero de 2025, una consulta promovida por organizaciones del sector mostró que el 96,5 % de los escritores y traductores españoles exigía autorización expresa para que sus obras pudieran usarse en el entrenamiento de IA generativa. Aquella encuesta dejaba otro dato igual de importante: una parte relevante del sector no cerraba del todo la puerta a una colaboración futura, pero reclamaba un marco seguro, reglas claras y una negociación seria. Esa posición sigue viva. No todo el mundo dice “no” a la IA; muchísima gente dice “así, no”.

El Gobierno español también ha ido dando bandazos. A comienzos de 2025 el Ministerio de Cultura retiró la tramitación de un real decreto sobre licencias para IA generativa por falta de consenso y abrió diálogo con el sector cultural. Meses más tarde, en octubre de 2025, el propio Gobierno, junto con autores, editores y CEDRO, expresó públicamente su compromiso de impulsar una IA española respetuosa con los derechos de autor. El problema es que, entre la declaración de intenciones y el diseño fino de un sistema eficaz, hay un desierto técnico y político nada pequeño. Quién autoriza. Quién cobra. Cómo se verifica qué obras han sido usadas. Cómo se compensa lo ya empleado. Qué ocurre con modelos entrenados antes de las nuevas exigencias de transparencia. Ahí está el atasco de verdad.

Todo eso explica por qué el manifiesto presentado en Madrid aprieta tanto. No llega cuando el problema está resuelto, sino cuando el sector sospecha que puede normalizarse una mala solución: aceptar usos masivos de obras protegidas a cambio de promesas vagas, resúmenes genéricos y una negociación difusa donde el creador individual casi no pinta nada. De ahí que los autores pidan un acuerdo con el Gobierno que regule tanto el entrenamiento de la IA por parte de desarrolladores privados y administraciones públicas como la explotación comercial posterior de esos modelos.

El precio pendiente de cada página

Lo que late bajo esta disputa no es una fobia a la tecnología ni un lamento romántico por el pasado. Es una pelea muy terrenal sobre quién pone el material, quién se queda el valor y quién asume las reglas. Si una inteligencia artificial generativa necesita millones de textos de calidad para funcionar, y entre esos textos hay novelas, ensayos, poemas, traducciones y obras científicas protegidas, el sistema no puede seguir comportándose como si el contenido cultural fuera aire. No lo es. Tiene autor, derechos, contexto, mercado y coste.

La palabra expolio incomoda porque corta por lo sano. Señala que, detrás de la retórica del progreso, puede haber una transferencia brutal de valor desde los creadores hacia plataformas capaces de convertir ese caudal en productos escalables y multimillonarios. Los escritores españoles que han firmado el manifiesto no están discutiendo una hipótesis excéntrica. Están poniendo nombre a una sospecha cada vez más compartida en Europa: que la IA generativa se ha desarrollado demasiado deprisa y con demasiada oscuridad sobre el origen de buena parte de su alimento textual.

El pulso, así planteado, no va de impedir que una máquina aprenda. Va de fijar qué puede aprender, con qué permiso y a cambio de qué. Si ese marco no llega, la industria cultural seguirá viendo en la IA no una herramienta nueva, sino una máquina que entra en la biblioteca de madrugada, se lleva páginas enteras sin hacer ruido y después devuelve un producto reluciente diciendo que aquello, en realidad, nunca fue un libro sino solo datos.

Newsletter

Periodista internacional con más de 20 años de experiencia en radio, prensa y medios digitales. Licenciado en Ciencias de la Comunicación, trabaja entre España e Italia con la mirada puesta en la actualidad.

Lo más leído