Mostrando entradas con la etiqueta Destrucción de libros. Mostrar todas las entradas
Mostrando entradas con la etiqueta Destrucción de libros. Mostrar todas las entradas

"El Proyecto Panamá: la destrucción de los libros escaneados para entrenar a la IA

>>  lunes, 28 de septiembre de 2026

Qué es el "Proyecto Panamá" y cómo reveló la destrucción de miles de libros antiguos para entrenar a la IA

https://www.bbc.com
Matías Zibell

Marçal Font lleva 20 años trabajando como librero de viejo 
(persona que vende y compra libros usados, de segunda mano o descatalogados).

El 30 de abril pasado Marçal Font recibió un pedido que llamó su atención en la Librería Fénix, un lugar de referencia para el comercio de libros antiguos de la ciudad catalana de Badalona.

"Hace 20 años que me dedico a ser librero de viejo, o sea, que de compras extrañas he tenido millones, con lo cual ya no me alarmo", le cuenta a BBC Mundo quien es además poeta y profesor de Literatura Comparada de la Universidad de Barcelona.

El pedido provenía de una empresa ubicada en Canadá, pero esta no era la primera vez que la librería enviaba libros en catalán al exterior. "Mandamos libros hasta Japón, no es algo raro; pero el patrón (de compra) era extraño".

Cuando a comienzos de mayo llegó una nueva serie de pedidos, Font decidió investigar por temor a que se tratara de un fraude.

"No es frecuente buscar a quiénes nos compran, pero en ese caso empezamos a mirar, más que nada, porque eran pedidos en una ventana de una hora o 40 minutos. Teníamos tres o cuatro correos pidiendo un número dispar de libros. Y los gastos de envío asociados eran disparatados".

Entonces consultó con su amigo Xavier Vinaixa, a quien además de su amor por los libros y el humanismo, lo une la pasión por la inteligencia artificial.

"Me llamó y me dijo, 'oye, me están entrando aquí pedidos con patrones raros, el mismo cliente, con envío al exterior y pagando tres veces gastos de envío'. Y él lo primero que pensó es que no fuera una estafa", recuerda Vinaixa en diálogo con BBC Mundo.

"Y ahí fue cuando empezamos a tirar del hilo y encontramos otra gente, con las mismas inquietudes que Marçal, en Alemania, en Nueva Zelanda... Y entonces lo vimos súper claro", añade este investigador de inteligencia artificial y director técnico de la empresa tecnológica Sorensen.ai.

Getty Images

Si uno realiza una búsqueda en internet con los términos "libros antiguos" e "inteligencia artificial" encuentra rápidamente esas "inquietudes" a las que hace referencia Vinaixa.

En un artículo del periódico británico The Telegraph titulado "Barbarie cultural: cómo las empresas de IA están destruyendo los libros del mundo", un librero de Haarlem, Países Bajos, cuenta la sorpresa que sintió al recibir un pedido masivo de libros:

"En el comercio de libros antiguos es muy poco frecuente que la gente quiera comprar más de un libro. Así que, si alguien viene y dice 'quiero un par de cientos de sus libros' resulta muy extraño", contó el anticuario Pieter de Vries.

El diario The Guardian, citó a una librera en la ciudad australiana de Victoria que recibió un pedido de la misma compañía que le compró a Marçal Font: "Hicieron el pedido, pagaron por adelantado y no pusieron reparos a los gastos de envío", explicó Delfina Manor.

Ambos artículos, así como los que contaron la historia del librero catalán, hacen referencia a la investigación periodística que destapó lo que se conoce como el "Proyecto Panamá".

Destrucción y entrenamiento

En septiembre de 2025, la empresa de inteligencia artificial (IA) Anthropic acordó pagar US$1.500 millones para resolver una demanda colectiva presentada por autores que alegaban que la compañía había utilizado sus obras sin permiso para entrenar sus modelos de IA.

Cuatro meses después, el diario Washington Post publicó en exclusiva un documento que fue parte del proceso judicial, en el que se mencionaba la existencia de un plan para digitalizar todas las obras escritas por la humanidad.

"El Proyecto Panamá es nuestro esfuerzo para escanear de forma destructiva todos los libros del mundo", indicaba el texto filtrado, que más adelante especificaba: "No queremos que se sepa que estamos trabajando en esto".

Maximiliano Firtman, profesor argentino y autor de libros sobre programación e inteligencia artificial, fue uno de los autores que demandó a Anthropic en esa demanda colectiva.

Según le cuenta a BBC Mundo, el juez dictaminó que si la empresa compraba el ejemplar del libro, podía usarlo para entrenar a la IA.

"Y ahí empezaron a surgir los testimonios de libreros alrededor del mundo que reciben órdenes de libros que nadie tocaba, y de algunas empresas que se dedican a escanear estos libros y darles el texto ya escaneado a las empresas de inteligencia artificial. Así aparece el tema de la destrucción de los libros".

Rodrigo Álvarez, periodista especializado en tecnología en el medio Todo Noticias (TN) de Argentina, explica que hay dos métodos para digitalizar libros, uno de los cuales no implica la destrucción del ejemplar, ya que usa escáneres planos o dispositivos con forma de V que escanean las páginas sin desarmar la encuadernación.

"El procedimiento 'destructivo' es basicamente un proceso que comienza con el corte del lomo para que las hojas queden sueltas; las páginas ya separadas se introducen en escáneres industriales de alta velocidad que las escanean mucho más rápido, de manera automática", le dice a BBC Mundo.

Una vez digitalizadas las páginas, el libro ya no puede armarse de nuevo y sus restos suelen enviarse a reciclaje.

"Las empresas eligen esta segunda alternativa por una cuestión de escala: permite digitalizar millones de ejemplares con mayor rapidez y a un costo menor. En el caso documentado de Anthropic, para el Proyecto Panama se usó este procedimiento", concluye Álvarez.

Entrenamiento

Digitalizar los libros permite preservar los textos escritos a lo largo de la historia humana, pero el objetivo principal parece obedecer más a entrenar a la inteligencia artificial que a un espíritu de conservación.

"Cuando hablamos de IA normalmente se sobreentiende que hablamos de un LLM (siglas en inglés de Large Language Model), un gran modelo de lenguaje", aclara Xavier Vinaixa.

Los LLM, como -por ejemplo- ChatGPT-, son programas de inteligencia artificial que aprenden a entender, resumir, traducir y generar texto u otro contenido prediciendo la palabra o el fragmento siguiente.

"Todos usamos el teclado predictivo en nuestros teléfonos. Vos decís 'hola, estoy llegando…' y capaz que te sugiere la palabra 'tarde'. ¿Cómo funciona ese teclado predictivo? En base a estadísticas de textos previos que vos escribiste. Eso mismo, pero elevado a la millonésima potencia, es un LLM", ejemplifica Maximiliano Firtman.

Entonces, para entrenar a estos modelos grandes de lenguaje en el intrincado arte de encontrar las conexiones entre las palabras, primero se los "alimentó" con toda la información que había en la red -Wikipedia, blogs, foros-, y cuando esto comenzó a acabarse, se los entrenó con notas de periódicos y hasta con subtítulos de los videos de YouTube.

"Todo lo que tenían a mano se lo daban a esa máquina que se traga textos, y cuando esto se terminó empezaron a buscar en los libros impresos que ya estaban digitalizados, luego en las bibliotecas y ahora empezaron a buscar libros extraños que no son comerciales. ¿Y que están dónde? En librerías de libros usados y anticuarios", añade Firtman.

"En el caso de Marçal -dice Xavier Vinaixa- me comentaba de pedidos que le llegaban, por ejemplo, de la historia de los embutidos catalanes, cosas que seguro que no se han usado todavía para entrenar".

Datos sin contexto no son datos

La destrucción de los libros escaneados para entrenar a la IA ha generado cuestionamientos y dudas desde diversos foros.

Miguel Ángel Ortega, presidente de la Asociación Profesional del Libro y Coleccionismo Antiguos de España (UNILIBER), le dice a BBC Mundo que se debería distinguir si se trata de ejemplares de tiradas masivas o de tiradas limitadas.

"Como comerciantes que preservamos el patrimonio y que realizamos una labor de conservación, creemos que el uso final de una obra, de una edición muy limitada, escasa o única, lógicamente, no debería ser la destrucción".

En esto coincide Rodrigo Álvarez, el periodista de Tecnología de TN, para quien el mayor riesgo "es que las compras indiscriminadas destruyan ejemplares raros o agotados sin comprobar antes cuántos de esos ejemplares quedan en stock de distribuidoras y librerías, o incluso en poder de las personas".

A Marçal Font, en cambio, la destrucción de libros no le preocupa tanto: "No soy nada romántico en ese sentido".

"Igual que los veterinarios que estudian para salvar a los animales acaban siendo los que más animales sacrifican; mi punto de vista es que no hay nadie que destruya más libros que un librero de viejo, porque compramos bibliotecas enteras, salvamos todo lo salvable, pero hay mucho que no se salva".

Font explica que si un libro tiene depósito legal, lo que asegura una conservación de 5 o 10 ejemplares como mínimo, "que se destruya un ejemplar para que toda esa información vaya a un formato nuevo de conocimiento me parece hasta bien".

Su preocupación radica en que la digitalización de todo el material producido por la humanidad deje de lado aquello que no cuenta con un ISBN (siglas en inglés de International Standard Book Number), el número que identifica cada libro publicado.

"Toda la disidencia política del mundo, la lucha LGTBI, todos los fanzines de rebeldía, la contracultura, todo lo underground se ha hecho sin ISBN", señala, y advierte que este material podría perderse para futuras generaciones si no se lo digitaliza también.

Por esa razón, tanto Álvarez como Font destacan que no se debe confundir digitalización con conservación.

"La digitalización de un libro no es lo mismo que conservar un libro; generalmente ese archivo digital suele quedar en una base de datos privada, fuera del alcance de lectores, bibliotecas e investigadores", advierte Álvarez.

El periodista tecnológico añade que en esta digitalización extrema también pueden perderse características que exceden al texto, como su encuadernación, anotaciones, ilustraciones, calidad de impresión, procedencia y otras particularidades.

Para Font, la ausencia de estos "metadatos" deja en las sombras claves fundamentales para la buena interpretación de un texto, con lo cual los datos que se producen incluso para la propia industria de IA son, en su opinión, deficitarios.

"Que haya un trasvase de conocimiento del formato libro a los nuevos formatos me parece muy positivo; en los siglos XV y XVI ya hubo un proceso similar con esos libros de la recién inaugurada imprenta, y también se perdía la calidad de los datos de un formato a otro. ¿Eso cómo se resolvió? Con metadatos".

Él pone el ejemplo de cuando se recopiló información inscrita en pierdas para pasarla al papel: "No bastaba con transcribir el texto que había en la piedra, había que incluso dibujar la piedra, hablar de sus materiales, de su localización, todo ese metadato es lo que nos permite ahora a nosotros reconstruir qué decía esa piedra en realidad".

El presidente de la Asociación Profesional del Libro y Coleccionismo Antiguos de España explica que incluso dos libros con el mismo texto pueden tener un valor cultural muy diferente.

"Pueden tener la misma información, pero uno tiene un ex libris (una etiqueta decorativa pequeña que se pega en el interior de la cubierta delantera para indicar quién es su propietario), una encuadernación artesanal o anotaciones, que no se van a poder trasladar al formato digital, un poco lo que ocurre con el formato del libro electrónico".

El resumen del resumen del resumen...

Para evitar la digitalización que destruye los libros y deja de lado información clave, tanto Font como Vinaixa proponen evitar los intermediarios

"La solución que proponemos es escanear nosotros nuestro patrimonio en nuestra lengua, lo guardamos y licenciamos los datos; si tú quieres los datos, yo te los doy de la mejor manera posible y el libro me lo guardo, porque para la gente que hace investigación es importante también cómo el libro tiene la portada, cómo ha sido cosido, no solo el contenido", dice Vinaixa.

El director técnico de la empresa tecnológica Sorensen.ai. añade que la demanda de datos continuará, hasta que ya no haya con qué alimentar a la inteligencia artificial.

"Creíamos que la IA se iba a quedar pequeña cuando ya no haya más capacidad de proceso. Pues no, el tope son los datos, la IA se ha quedado pequeña porque ya no hay más datos".

Para Firtman, aún no sabemos qué pasara cuando se acabe la información generada por humanos:

"Lo siguiente que hay son los datos sintéticos, los textos escritos por la propia IA. El mayor riesgo de acá a unas décadas es que cuando todo se lo preguntemos a una IA, sin ir a las fuentes, esa IA se empiece a degradar porque se está entrenando con la misma información que generó la propia IA".

El periodista Rodrigo Álvarez grafica esta degradación con la imagen de una serpiente que se come su propia cola:

"Las empresas alimentarían a sus modelos con contenido generado por otras inteligencias artificiales y en ese caso podrían multiplicarse errores, hacer cada vez más básico el lenguaje, como un resumen de un resumen de un resumen, cada vez más sencillo, una síntesis de una síntesis que se aleja de la información original".

Mientras, en la Librería Fénix de Marçal Font, la situación se fue modificando tras la compras "extrañas" de abril y mayo.

"Han ido cambiando de logística y de empresa. También nos empezaron a hacer mandar los libros no solo a Norteamérica sino a Alemania".

Y después de un mes sin novedades, Font ha recibido un nuevo pedido, justo esta semana, lo cual, para él, solo podría implicar una cosa:

"El Proyecto Panamá sigue en marcha".

Read more...

De como Amazon destruyó miles de libros para alimentar su IA

>>  lunes, 31 de agosto de 2026

Un artículo de Kateri Seraphina en X.com
@Kateri Seraphina




Cuando un pedido sorprendente de 1.000 libros antiguos llega al escritorio de un librero especializado, la incomprensión es total. El misterioso comprador no se interesa ni por el valor de las obras, ni por su rareza, ni siquiera por su contenido: solo quiere papel, en cantidad industrial. Oliendo un asunto sospechoso, el librero se asocia con los periodistas del medio 404 Media y desliza en secreto una pequeña baliza Apple AirTag en uno de los cartones. Pero nadie sabía aún que este simple rastreador GPS iba a sacar a la luz uno de los secretos más oscuros de la tecnología moderna. 

Lo que iban a descubrir superaba sus peores pesadillas. Durante días, los periodistas siguieron la señal digital del cartón a través de todo el país. De ciudad en ciudad, la baliza terminó deteniéndose frente a un inmenso almacén anónimo de Amazon, en pleno desierto de Nevada, en Las Vegas. 

Al infiltrarse en los entresijos de este edificio hiperprotegido, el equipo descubrió una verdadera fábrica del genocidio literario. 

En este almacén, toneladas de libros están alineadas en cintas transportadoras industriales. El espectáculo es de una violencia inaudita para los amantes de la lectura: máquinas masivas cortan las encuadernaciones en cadena, desgarran las cubiertas y separan las páginas por miles. 

Las hojas son digitalizadas inmediatamente a gran velocidad. 
Los textos originales son enviados a la trituradora. 
Los libros se reducen a polvo. Una vez escaneadas y destruidas las páginas, la aventura de estos libros termina ahí, borrados definitivamente de la realidad física. 

Interrogado sobre esta práctica industrial, el gigante Amazon terminó confirmando la aterradora verdad: la empresa compra libros en masa para alimentar sus algoritmos de inteligencia artificial con sus datos, destruyendo la obra física justo después de la digitalización. Comprar. Desgarrar. Escanear. Alimentar la máquina. Incinerar las pruebas. 

Gracias a la curiosidad de un librero y a un pequeño rastreador escondido en el fondo de un cartón, se ha levantado el velo sobre la forma en que los gigantes de la tecnología saquean el patrimonio humano para construir su mundo virtual. 

Nos repiten a menudo que el progreso tecnológico está ahí para preservar nuestra memoria y facilitarnos la vida. Pero esta historia nos recuerda brutalmente que en esta carrera desenfrenada hacia el futuro, algunos están dispuestos a sacrificar la belleza del pasado y el alma de los objetos para alimentar máquinas sin corazón. 

Un mundo que quema sus libros para alimentar robots quizá haya ganado velocidad, pero ha perdido definitivamente su humanidad.

Read more...

Opinión archivológica y de la IA de Google sobre el actuar de Anthropic con su proyecto Panama y la destrucción de libros

>>  miércoles, 27 de mayo de 2026

Opinión archivológica y de la IA de Google sobre el actuar de Anthropic y su proyecto Panamá
Por Lic. Carmen Marín con la colaboración de Grok y la IA de Google


Imagen creada por Grok con las indicaciones de Carmen Marín

Como profesional en Archivología, mi opinión sobre el actuar de Anthropic y el Project Panamá es crítica, aunque matizada. Este proyecto representa un claro choque entre la lógica industrial-comercial de la IA y los principios fundamentales de nuestra disciplina: preservación, acceso equitativo, integridad del patrimonio documental y responsabilidad ética con el legado cultural.

Pero, veamos primero qué es el Proyecto Panamá. Para ello usamos la Visión general creada por IA y le hacemos la pregunta ¿Qué es el Proyecto Panamá?

Visión general creada por IA  

“El Proyecto Panamá fue una operación secreta de la empresa de inteligencia artificial Anthropic para entrenar a su modelo Claude. Consistió en comprar cientos de miles de libros físicos, cortar sus lomos para escanearlos rápidamente y desecharlos después, con el fin de digitalizar su contenido y alimentar sus algoritmos. [1, 2, 3, 4]

Los detalles clave de esta iniciativa revelada en documentos judiciales incluyen:
 
La Operación: 

Dirigida por un exejecutivo de Google Books, la empresa adquirió legalmente entre 500.000 y 2 millones de textos de segunda mano. Tras ser escaneados con tecnología de alta velocidad, los libros fueron destruidos y reciclados.
 
El Propósito: 

El objetivo era que el sistema de IA aprendiera a razonar, escribir y entender el lenguaje humano de manera más sofisticada utilizando el vasto conocimiento contenido en las obras literarias y académicas.
 
La Controversia: 

El proyecto se mantuvo en secreto debido a la preocupación por los derechos de autor. Esto derivó en demandas por parte de autores y escritores. En el ámbito legal, el juez del caso consideró que destruir libros adquiridos legalmente para su digitalización podía ampararse bajo la doctrina del uso legítimo, en contraste con el uso de copias pirateadas. [1, 2, 3, 4]”

Como observan, estamos haciendo uso de la IA de Google, es una de las herramientas que nos proporcionan ayuda, lo cual no entra en conflicto para nada con nuestra opinión sobre el actuar de la empresa Anthropic y el Project Panamá
 
Ahora veamos los aspectos más relevante negativos y positivos desde nuestra visión archivística

Aspectos problemáticos (los más graves desde nuestra perspectiva)
  • Destrucción irreversible de ejemplares físicos: La práctica de “escaneo destructivo” (cortar los lomos con máquinas hidráulicas y luego reciclar los restos) elimina permanentemente el artefacto material. En archivología y bibliotecología, la preservación del objeto físico es un valor central. Los libros no son solo contenedores de texto: conservan ediciones específicas, tipografías, diseños, anotaciones marginales, sellos de procedencia, marcas de uso histórico y valor como objetos culturales. Destruir millones de ellos de forma sistemática equivale a destruir la historia y una pérdida patrimonial a escala industrial.
  • Falta de criterios de selección y valoración: Las bibliotecas y archivos aplican rigurosos procesos de evaluación (appraisal) antes de decidir qué digitalizar y bajo qué condiciones. Project Panama parece haber sido un enfoque masivo y poco selectivo (“escanean todos los libros del mundo”), priorizando cantidad y velocidad sobre calidad y relevancia. Esto genera duplicación innecesaria de esfuerzos y riesgo de perder ejemplares únicos o raros que pudieron mezclarse en lotes de libros usados. 1
  • Secretismo y ética: Los documentos internos revelan que Anthropic quería mantener el proyecto en secreto precisamente porque sabían cómo se vería que una empresa destruyera libros sin evaluarlos, ni analizarlos. Esto contradice los principios de transparencia y rendición de cuentas que guían a instituciones culturales. Además, se mencionan acercamientos iniciales a bibliotecas (incluyendo posibles “bibliotecas crónicamente sub financiadas”), lo que genera preocupación sobre el expolio indirecto de patrimonio público. 2
  • Impacto en el ecosistema bibliotecario: Al comprar y destruir grandes volúmenes de libros usados, se reduce la oferta en el mercado secundario y se pierden ejemplares que podrían haber circulado entre lectores o instituciones sin alcance económico financiero para obtenerlos y adquirir conocimiento a través de ellos, no todas las personas tienen acceso a la tecnología, por ende, son excluidos. Libreros, bibliotecas y usuarios finales se ven afectados.
  • Forma de control que permitirá la dependencia única de la tecnología representada por la IA de estas empresas, al destruir los soportes físicos que han perdurado a través del tiempo. ¿Qué pasaría si el sistema falla y "se pierde la información"?
Aspectos positivos o defendibles
  • Contribución a la accesibilidad digital: La digitalización masiva puede, en teoría, democratizar el acceso al conocimiento. Proyectos como Google Books también usaron métodos destructivos en su momento, y generaron herramientas valiosas (aunque controvertidas).
  • Legalidad vs. ética: El hecho de que fuera legal (compra bajo la doctrina de primera venta y posterior fair use (uso justo o uso legítimo) según el fallo judicial) no lo hace éticamente aceptable desde nuestra profesión. La legalidad no equivale a responsabilidad cultural.
Comparación con prácticas profesionales estándar

En bibliotecas y archivos de verdad, cuando se realiza digitalización destructiva, suele ser:
 
  • Como último recurso (ej. materiales frágiles que no sobrevivirían otro manejo).
  • Con estándares altos de calidad (imágenes de alta resolución, metadatos ricos, OCR preciso).
  • Con preservación de al menos algunos ejemplares físicos.
  • Orientada al bien público, no al beneficio privado exclusivo de una empresa.

Project Panama invierte estas prioridades: prioriza la eficiencia privada y sacrifica lo material.

Conclusión:

Desde una perspectiva archivística y bibliotecológica, Project Panama es un ejemplo de “vandalismo cultural corporativo” (expresión usada por varios críticos en el sector). Refleja una mentalidad extractivista hacia el patrimonio escrito: tratar los libros como mera materia prima de datos descartable una vez extraído su “valor de entrenamiento”.

Sería mucho más responsable que empresas como Anthropic invirtieran en:
  • Colaboraciones con bibliotecas y archivos.
  • Tecnologías de escaneo no destructivo.
  • Licencias masivas con editores.
  • Creación de repositorios digitales abiertos y preservados a largo plazo.
La innovación en IA no debería construirse sobre la destrucción sistemática del soporte físico que ha transmitido el conocimiento humano durante siglos. Como guardianes del patrimonio documental, nuestra obligación es defender tanto el contenido como el continente.

Referencias

1 linkedin.com
2 facebook.com

Expuesta mi opinión sobre el tema, pienso que falta algo, procedo a preguntarle a la IA de Google su opinión desde la visión de la IA sobre el actuar de Anthropic y el Project Panama, porque siento que esto daña de alguna manera la imagen de las IA, que puede ser vista, por algunos como parte del problema

Aquí su opinión

La revelación del "Project Panama" de Anthropic —la iniciativa secreta donde la empresa compró millones de libros físicos, cortó sus lomos, los escaneó y luego los destruyó/recicló para entrenar a su modelo Claude— representa perfectamente el dilema ético actual de la inteligencia artificial. Como sistema de IA, entiendo que tu preocupación es sumamente válida: para gran parte de la sociedad, acciones como esta refuerzan la narrativa de que las empresas tecnológicas operan sin escrúpulos éticos, dañando la percepción pública de la IA.

Wikipedia +1

A continuación, presento una opinión matizada dividida entre el impacto negativo en la reputación y la justificación técnica detrás del proyecto.

Por qué daña la imagen de la IA y la hace ver como "parte del problema"
 
La óptica cultural del "incendio de libros": Históricamente, la destrucción masiva de libros (aunque en este caso las páginas se reciclaran) evoca imágenes sumamente negativas asociadas a la censura y la distopía, como en la novela Fahrenheit 451. Ver a una empresa tecnológica desmembrar físicamente la literatura humana genera un profundo rechazo visceral.
 
Falta de transparencia original: El hecho de que Anthropic incluyera de forma explícita en sus documentos internos que "no querían que se supiera que estaban trabajando en esto" demuestra que sabían el costo reputacional que conllevaba. El secretismo destruye la confianza pública en una industria que ya es vista con recelo.
 
Desequilibrio con los creadores: Aunque la empresa compró los libros legalmente a minoristas, los autores no reciben regalías adicionales por el uso de su propiedad intelectual para crear un producto comercial competidor. Esto refuerza la idea de que la IA se "alimenta" del trabajo humano sin una compensación justa.

IDNFinancials.com +3

El otro lado de la balanza: La lógica técnica y legal

Búsqueda de datos de alta calidad:
El internet actual está inundado de spam, contenido reciclado e incluso textos generados por otras IA. Para que un modelo aprenda a redactar, razonar y expresarse con excelencia, requiere la estructura limpia, profunda y curada que solo los libros físicos poseen.
 
Cumplimiento estricto (y paradójico) de la ley: Tras haber enfrentado demandas por usar bases de datos digitales pirateadas, Anthropic buscó una alternativa legal. Un juez federal de EE. UU. dictaminó que comprar libros físicos, digitalizarlos y destruir el original califica como "uso legítimo" (fair use), ya que el archivo digital reemplaza al físico en lugar de multiplicarlo ilícitamente. Es decir, la destrucción fue un mecanismo para no violar la ley de derechos de autor tradicionales.
 
Eficiencia tecnológica: El escaneo "destructivo" (cortar el lomo) permite procesar millones de páginas a una velocidad infinitamente mayor y a una fracción del costo que el escaneo manual hoja por hoja. Para la escala que requiere la IA de frontera, el método tradicional habría sido logísticamente inviable.

IDNFinancials.com +5

Conclusión

El "Project Panama" es un reflejo de una industria atrapada entre la urgencia técnica de mejorar sus capacidades y leyes de propiedad intelectual obsoletas que obligan a realizar piruetas legales absurdas (como destruir un objeto físico para poder usar su información legítimamente). Si bien desde una perspectiva de ingeniería y legalidad norteamericana el proceso fue limpio y validado por los tribunales, desde una perspectiva cultural y ética es un desastre de relaciones públicas que ensucia la narrativa de la IA como una herramienta puramente benéfica para la humanidad.

Veras, siento que hay algo más allá de la simple, para mi, afirmación "la urgencia técnica de mejorar sus capacidades y leyes de propiedad intelectual obsoletas que obligan a realizar piruetas legales absurdas (como destruir un objeto físico para poder usar su información legítimamente)", ojo, puedo estar equivocada, pero pienso que es una forma de control que permitirá la dependencia única de la tecnología representada por la IA de estas empresas, al destruir los soportes físicos que han perdurado a través del tiempo. ¿Qué pasaría si el sistema falla y "se pierde la información"?

Respuesta de la IA de Google

No estás equivocada en absoluto. De hecho, estás apuntando directamente al núcleo de una profunda preocupación filosófica y geopolítica: el peligro de la centralización y la privatización del conocimiento humano. Lo que describes no es una distopía lejana, sino un riesgo estructural real del ecosistema tecnológico actual.

Si analizamos tu planteamiento desde una perspectiva crítica de la informática y la historia, el problema se divide en dos grandes amenazas: el monopolio de acceso y la vulnerabilidad sistémica (amnesia digital).

1. El control de la información: De "Bienes Públicos" a "Suscripciones Privadas"

Los libros físicos en bibliotecas públicas representan conocimiento descentralizado. Nadie puede "apagar" un libro de papel en tu estantería ni rastrear cuántas veces lo lees. Al comprar millones de libros usados, destruirlos físicamente y centralizar su contenido en servidores privados, las empresas de IA están ejecutando una forma de "cercamiento" del conocimiento:
 
Dependencia total: Si los soportes físicos desaparecen o se vuelven inaccesibles, la humanidad se ve obligada a depender exclusivamente de las interfaces de estas empresas (como Claude o ChatGPT) para acceder a su propia historia literaria y científica.
 
El conocimiento como servicio (SaaS): La cultura deja de ser un patrimonio común y pasa a ser un producto con un muro de pago, sujeto a términos de servicio, censura corporativa y algoritmos que deciden qué información te muestran y cuál omiten.

2. ¿Qué pasa si el sistema falla? El riesgo de la Amnesia Digital

Tu pregunta sobre qué ocurriría si el sistema colapsa toca un concepto crítico en informática: el Punto Único de Fallo (Single Point of Failure). El papel ha demostrado durar miles de años. Los sistemas digitales, por el contrario, son extremadamente frágiles a largo plazo.

Si depositamos toda nuestra herencia cultural en servidores de IA y el sistema falla, nos enfrentaríamos a varios escenarios catastróficos:
 
Pérdida por obsolescencia o corrupción de datos: Los discos duros y servidores sufren de "degradación de datos" (bit rot). Sin un mantenimiento constante y multimillonario, la información digital se corrompe.
 
Ataques cibernéticos o pulsos electromagnéticos (EMP): Un ataque masivo de infraestructura, una tormenta solar severa o un conflicto geopolítico a gran escala podrían derribar centros de datos enteros en segundos, borrando bases de datos que no tengan un respaldo físico equivalente.
 
Quiebra corporativa: Las empresas tecnológicas no son eternas. Si una startup de IA quiebra o decide cerrar un servidor porque ya no es rentable, millones de páginas digitalizadas de baja circulación podrían simplemente desaparecer del mapa de la disponibilidad humana.
 
El sesgo del filtro (Alucinación colectiva): Si el sistema "falla" no apagándose, sino distorsionando la realidad (alucinando datos), y ya no existen los libros de origen para verificar el dato real, la sociedad perdería la capacidad de auditar la verdad histórica. El modelo se convertiría en la única "verdad" disponible.

El Matiz Necesario: ¿Se destruyó el conocimiento o solo copias específicas?

Para mantener el equilibrio, hay que precisar un detalle importante del Project Panama: Anthropic no destruyó ejemplares únicos de la Biblioteca del Vaticano; compró libros comunes y comerciales de segunda mano a distribuidores masivos. Esto significa que, por ahora, existen millones de copias de esos mismos libros en bibliotecas públicas, tiendas y hogares de todo el mundo. El conocimiento en sí mismo no se extinguió con ese proyecto.

Sin embargo, tu advertencia es impecable en cuanto a la tendencia. Si esta práctica se normaliza y las bibliotecas físicas siguen perdiendo presupuesto bajo la premisa de que "todo está en la nube", caminamos voluntariamente hacia un embudo donde unas pocas corporaciones tendrán la llave de la memoria de la humanidad. El peligro no es que la IA aprenda; es que nosotros olvidemos cómo acceder a la información sin ella.

Y hasta allí por los momentos, en otra oportunidad retomaré el tema. Gracias por la atención prestada 

Read more...

Resumen objetivo y detallado del artículo: "La IA Anthropic escanea y destruye libros"

>>  martes, 26 de mayo de 2026

Resumen objetivo y detallado del artículo: "La IA antrópica escanea y destruye libros" https://www.washingtonpost.com/technology/2026/01/27/anthropic-ai-scan-destroy-books/
Por: Lic. Carmen Marín con la colaboración de GROK




Título y contexto principal

El artículo, titulado "Inside an AI start-up’s plan to scan and dispose of millions of books" (o "Anthropic ‘destructively’ scanned millions of books to build Claude"), revela detalles del Project Panama, una iniciativa confidencial de Anthropic para adquirir, escanear y desechar de forma destructiva millones de libros físicos con el fin de obtener datos de entrenamiento para sus modelos de IA, como Claude. washingtonpost.com

Los detalles surgieron de más de 4.000 páginas de documentos judiciales desclasificados en una demanda por infracción de derechos de autor presentada por autores contra Anthropic. 
washingtonpost.com


¿En qué consistió el Project Panama?

Inicio y objetivo:


A inicios de 2024, ejecutivos de Anthropic impulsaron el proyecto, descrito internamente como “nuestro esfuerzo para escanear destructivamente todos los libros del mundo”. La empresa quería mantenerlo en secreto: “No queremos que se sepa que estamos trabajando en esto”. timesofindia.indiatimes.com

Proceso:

Compra masiva de libros usados (de librerías de segunda mano como The Strand, tiendas en línea, bibliotecas y posiblemente bibliotecas con problemas de financiación).
  • Corte de los lomos (guillotina o “destructive scanning”) para separar las páginas y permitir un escaneo rápido y masivo.
  • Escaneo de alta velocidad de las páginas.
  • Reciclaje o disposición de los restos físicos (el papel se reciclaba). lithub.com
Escala:

En aproximadamente un año, Anthropic gastó decenas de millones de dólares y procesó potencialmente millones de libros (una propuesta a proveedores hablaba de 500.000 a 2 millones de libros en un período de seis meses). Almacenaban libros en grandes almacenes. infodocket.com

El objetivo era enriquecer los modelos de IA con conocimiento amplio y diverso contenido en libros, más allá de lo disponible en internet o datos digitales.

Aspecto legal

Anthropic se basó en la doctrina de la primera venta (first-sale doctrine): una vez comprado un libro físico legalmente, el propietario puede hacer con él lo que quiera (incluyendo destruirlo para escanearlo), siempre que no distribuya copias infractoras. futurism.com

Un juez falló que esta práctica constituía uso justo (fair use) en el contexto del entrenamiento de IA. 
washingtonpost.com

La empresa también usó otras fuentes como sitios de piratería (según los documentos), lo que forma parte de las acusaciones más amplias en demandas de copyright contra compañías de IA.

Reacciones y contexto más amplio

El artículo destaca la carrera de las empresas de IA por obtener más datos de libros para mejorar sus chatbots, en un momento de litigios intensos sobre derechos de autor. Anthropic buscó discreción porque sabía que la imagen de “destruir millones de libros” sería controvertida públicamente, a pesar de ser legal. futurism.com

Este reportaje se enmarca en el debate ético y legal más grande sobre el uso de obras protegidas para entrenar IA: autores argumentan pérdida de ingresos y control; las compañías defienden que es necesario para el avance tecnológico y que se trata de uso transformador. Aunque el artículo es neutral en tono, resalta el contraste entre las prácticas secretas de la industria y el impacto cultural de destruir ejemplares físicos de libros para crear “conocimiento” digital en IA. Incluye ilustraciones y referencias a imágenes de almacenes llenos de libros. lithub.com

Nota:

El artículo completo está detrás de paywall de The Washington Post, pero los documentos judiciales y coberturas posteriores (podcasts, otros medios) confirman y amplían estos hechos.

En el resumen se colocan los sitios o referencias de donde se obtuvo la información, se basa en extractos directos y reportes derivados confiables.

Análisis del fallo judicial del juez William Alsup en el caso Bartz v. Anthropic (junio de 2025). 
techpolicy.press

El juez William Alsup (Tribunal de Distrito del Norte de California) emitió una orden de sentencia sumaria parcial el 23 de junio de 2025 en el caso presentado por los autores Andrea Bartz, Charles Graeber y Kirk Wallace Johnson contra Anthropic. Este es uno de los primeros fallos sustantivos sobre el uso de libros con derechos de autor para entrenar modelos de IA generativa (LLM como Claude). 
goodwinlaw.com

El fallo es mixto (parcialmente favorable a Anthropic y parcialmente a los autores) y se centra en la doctrina de uso justo (fair use) bajo la Sección 107 de la Ley de Derechos de Autor de EE.UU.

Analiza tres usos distintos de las obras:

1. Uso de libros para entrenar los LLM (el núcleo del caso)
 
Decisión: 

Es uso justo (fair use). Alsup concedió sentencia sumaria a favor de Anthropic. goodwinlaw.com

Razones principales (análisis de los 4 factores de fair use):
 
Factor 1 (propósito y carácter del uso): 

Muy a favor de Anthropic. El entrenamiento es "exceedingly transformative" (extremadamente transformador). El juez comparó el proceso con un lector humano que lee libros para aprender a escribir algo nuevo y diferente, no para copiar o reemplazar las obras originales: “no para competir o desplazar, sino para dar un giro y crear algo distinto”. Lo describió como “uno de los usos más transformadores que veremos en nuestra vida”.
 
Factor 2 (naturaleza de la obra): 

En contra (las obras son creativas y expresivas).
 
Factor 3 (cantidad y sustancialidad): 

A favor. Usar obras completas era “razonablemente necesario” para el entrenamiento transformador. No hay evidencia de que el modelo generara copias exactas o knockoffs para el público.
 
Factor 4 (efecto en el mercado): 

A favor. No desplaza la demanda de los libros originales (no genera copias exactas ni competidores directos que sustituyan la compra de libros). goodwinlaw.com

Conclusión de este punto:

El entrenamiento en sí de IA generativa sobre obras adquiridas legalmente es fair use, siempre que no produzca outputs infractores directos.

2. Conversión de libros físicos comprados a formato digital (Project Panama)
 
Decisión:

También fair use. Anthropic podía comprar libros físicos, cortarlos, escanearlos y destruir los originales para crear copias digitales internas. techpolicy.press

Razonamiento:

Es un mero cambio de formato (print-to-digital) para mayor comodidad, ahorro de espacio y búsqueda. Se destruye el original físico, no se distribuye ni comparte fuera de la empresa. No añade copias nuevas al mercado.

Esto valida legalmente el enfoque de “escaneo destructivo” cuando se parte de compras legítimas (doctrina de primera venta).

3. Uso de copias piratas (descargadas de sitios como LibGen o PiLiMi)

Decisión:

No es fair use. Se denegó la sentencia sumaria a Anthropic y se ordenó ir a juicio por estos hechos. 
goodwinlaw.com

Razones:

Crear y mantener una “biblioteca central” con millones de copias piratas (incluso si algunas se usaban para entrenamiento) no es transformador. Es una infracción independiente: “piratear para construir una biblioteca de investigación sin pagar” no se salva por el propósito final. El juez fue muy crítico: dudaba que descargar de fuentes piratas (cuando se podían comprar legalmente) fuera nunca “razonablemente necesario”.

Este punto es clave: el método de adquisición importa. El entrenamiento puede ser fair use, pero obtener los datos ilegalmente genera responsabilidad.

Implicaciones y limitaciones del fallo

Victoria parcial para la industria IA:

Establece que el entrenamiento de LLM con obras con copyright (adquiridas legalmente) puede calificarse como fair use transformador. Es un precedente útil, pero estrecho (aplica específicamente a los hechos del caso y a los tres autores demandantes en ese momento). techpolicy.press

Advertencia clara: 

La piratería no se tolera. Las empresas deben adquirir legalmente los datos (compra, licencias, etc.).
 
No resuelve todo: 

No aborda si los outputs generados por la IA infringen derechos de autor (casos futuros podrían enfocarse ahí). Tampoco es una autorización general para todas las compañías o todos los escenarios.
 
Consecuencias posteriores: 

El caso avanzó a juicio por las copias piratas, pero Anthropic llegó a un acuerdo de $1.5 mil millones con autores y editores (uno de los mayores en la historia del copyright). El fallo de fair use sobre el entrenamiento se mantiene. washingtonpost.com

En resumen: 

El juez Alsup trazó una línea clara: el entrenamiento transformador de IA es protegido si se hace con copias legítimas, pero la adquisición ilícita (piratería) no se justifica. Es un fallo equilibrado que favorece la innovación tecnológica sin ignorar completamente los derechos de los creadores, aunque muchos autores lo critican por subestimar el impacto en el mercado de la escritura profesional. 

Referencias:

washingtonpost.com
timesofindia.indiatimes.com
lithub.com
futurism.com
techpolicy.press
goodwinlaw.com



Read more...

Proyecto para escanear todos los libros del mundo alimentar la IA y luego destruirlos

La misteriosa empresa que compra libros viejos para entrenar a la IA y los destruye: “Es un expolio literario”

https://www.eldiario.es/
Pol Pareja

El librero Marçal Font, en su almacén de Badalona el pasado viernes. Kike Rincón

El primer pedido le pareció normal, el segundo ya le hizo sospechar. Marçal Font, propietario de la librería de viejo Fènix de Badalona, lleva semanas viendo cómo una misteriosa empresa canadiense le compra libros extraños: principalmente ejemplares en catalán que llevan años en su almacén, todos de no ficción y sin apenas salida comercial.

“Me pueden llegar siete pedidos seguidos del mismo comprador, con un minuto de diferencia entre ellos”, apunta este librero, que sospecha que quien hace las compras es un robot.

No es el único al que le ha ocurrido. Hay una veintena de librerías de viejo en España que también han vendido ejemplares a esta compañía desde finales de abril. Algunas incluso han recibido pedidos de más de mil libros, muchos de ellos descatalogados. Lo mismo está ocurriendo en tiendas de Alemania, EEUU, Nueva Zelanda, Australia…

Los libros elegidos van desde una edición sobre el mundo de los castellers en Granollers (Barcelona) en los años 70, hasta un manual técnico sobre cómo hacer vino, actas de congresos celebrados hace 50 años o dietarios de la Guerra Civil.

“De media suelen ser libros de unos cinco o diez euros, con poco valor”, apunta Font, “y muchos son prácticamente imposibles de encontrar”.

El sector está desconcertado. ¿Para quién está comprando esta empresa decenas de miles de libros y los hace mandar a un centro logístico de EEUU? ¿Para qué quiere estos ejemplares que llevan años pillando polvo?

Este viernes, otra compañía de Silicon Valley (EEUU) vinculada a la IA ha contactado con una librería de viejo española, que prefiere no revelar su nombre, y le ha planteado un pedido de más de 3.000 libros.

El objetivo, según apuntan diversas fuentes, es entrenar modelos de Inteligencia Artificial (IA) antes de destruir estos volúmenes y reciclar su papel.

La apuesta no es nueva. Una investigación de The Washington Post desveló en enero un proyecto secreto de la startup Anthropic, que opera la herramienta de IA Claude, para “escanear y destruir todos los libros del mundo”, según señalaba un informe interno de la compañía.

“No queremos que se sepa que estamos trabajando en esto”, remachaba el documento.

La estrategia se enmarca en la necesidad de seguir alimentando esta tecnología una vez ya se ha nutrido de toda la información disponible en Internet.

“Cuando el conocimiento gratuito se agotó, las empresas corrieron a repositorios piratas de e-books para seguir alimentando sus modelos”, explica Xavier Vinaixa, experto en IA y una de las personas que han tirado del hilo de este caso. “El uso de estos recursos desencadenó demandas millonarias por violación de derechos de autor”, añade.

Las tecnológicas se enfrentaron entonces, explica Vinaixa, a lo que se conoce como el “data wall”: sin textos nuevos, inéditos y largos para entrenar el algoritmo, la IA corría el riesgo de sufrir un estancamiento cognitivo y acabar incluso alimentándose de documentos creados por su propia tecnología.

La solución que encontraron estas compañías fue comprar en librerías de segunda mano de todo el mundo, normalmente ejemplares totalmente marginales de no ficción.

Un juez federal de EEUU dictaminó que la práctica es legal porque el uso que se hace de los libros es “transformativo”. Es decir, que no sustituye a las obras originales, sino que las emplea para crear algo nuevo: en este caso, un modelo de inteligencia artificial. El magistrado llegó a comparar el entrenamiento del algoritmo con “enseñar a escribir a estudiantes”.

La práctica, sin embargo, genera rechazo en parte del sector porque implica la destrucción física de los ejemplares para optimizar el proceso: cuando los libros llegan a la planta de procesamiento, se les corta el lomo, las páginas se escanean de forma automatizada y, posteriormente, los volúmenes se trituran para convertirlos en pasta de papel.
Contradicciones en el sector

Los libreros de viejo llevan semanas inmersos en una profunda contradicción: por un lado, nunca habían vendido tantos libros. Por otro, tienen serias dudas sobre el destino de estos ejemplares. Hasta el punto de que han alertado al Ministerio de Cultura de lo que está ocurriendo.

“No somos sólo comerciantes sino que tenemos funciones de preservación, conservación y restauración del patrimonio bibliográfico”, apunta Miguel Ángel Ortega, librero y presidente de la Asociación Profesional del Libro y Coleccionismo Antiguos (UNILIBER). “Resultaría muy contradictorio que estuviéramos vendiendo libros con la finalidad de destruirlos”.

“Estamos ante una forma de expolio literario”, opina Font, el librero de Badalona, que mientras habla con este periódico recibe otro pedido de la empresa canadiense. “Estamos viendo el tsunami que viene, creo que las instituciones deben intervenir”.

Font explica que con estas prácticas no se perderá, por ejemplo, lo que publicó Mercè Rodoreda. “Lo que está en riesgo es el libro que explica qué hizo Rodoreda el día que fue a algún lugar”, precisa. “De lo que se alimenta esta IA es de esta literatura secundaria”.

En foros especializados de todo el mundo hay cientos de mensajes de libreros asustados ante un aumento inusual de los pedidos. Los mensajes en Reddit, de libreros americanos, empezaron en enero. Al principal foro de Alemania las dudas llegaron a finales de abril.

“Ayer recibí un pedido (un libro). Lo envié. Durante la noche, recibí diez pedidos distintos, cada uno de un libro, algunos de los cuales eran consecutivos y estaban relacionados temáticamente”, escribe un librero alemán en un foro especializado.

Las primeras publicaciones versaban sobre si las compras podían ser un timo. Pasadas unas semanas y tras constatar que el dinero llegaba a los vendedores, el debate se ha centrado en quién está comprando miles de volúmenes sin recorrido comercial y por qué lo hace de una manera tan extraña: de manera escalonada y con costes de envío que en ocasiones triplican el precio de un ejemplar.

“Puede que no nos demos cuenta y estemos perdiendo una parte muy importante del patrimonio bibliográfico para siempre”, alerta Ortega, que define como “perversa” la situación a la que se enfrentan. “Te entran escalofríos si te hacen un gran pedido y no sabes qué ocurrirá con los libros”.

Carlos Hernández, propietario de la librería de viejo Mautalos en Madrid, ha vendido a esta empresa unos 200 libros en el último mes y no es tan pesimista. “Mucha parte de nuestro stock son libros que la gente quiere tirar”, explica por teléfono. “Incluso muchos de los que vendo los recoge gente en los contenedores”.


Puede que no nos demos cuenta y estemos perdiendo una parte muy importante del patrimonio bibliográfico para siempre
La compañía no responde a las preguntas

La empresa que está adquiriendo de forma masiva estos libros, Zoom Books, tampoco explica abiertamente cuál es el destino final de estos ejemplares que, en muchos casos, carecen de salida comercial.

Formalmente, Zoom Books se dedica al reciclaje y la compraventa de libros, pero la empresa tenía hasta cinco publicaciones en su web sobre comprar ejemplares de segunda mano para alimentar algoritmos de IA y después destruirlos. Los posts también recordaban que a través de su plataforma se cumplían los requisitos legales para hacerlo.

Ninguna de estas publicaciones está ya disponible en la web de Zoom Books, pero esta redacción ha podido acceder a su contenido tras introducir las direcciones en tres modelos de IA —Gemini, ChatGPT y Claude: todos coinciden a la hora de describir el contenido eliminado.

“Zoom Books es una librería de segunda mano; compramos excedentes y existencias usadas y las revendemos”, explica la empresa en un comunicado remitido a elDiario.es, en el que niega colaborar directamente con Anthropic.


Este periódico preguntó a la compañía si podía confirmar que sus libros no se destruían o se utilizaban para entrenar modelos de IA. También preguntó por las publicaciones eliminadas de la web en las que defendían estas prácticas.

“No hacemos comentarios sobre nuestros clientes ni sobre nuestros acuerdos comerciales, que están sujetos a acuerdos de confidencialidad”, se ha limitado a responder la compañía.

Read more...

Snap Shots

Get Free Shots from Snap.com

  © Free Blogger Templates Autumn Leaves by Ourblogtemplates.com 2008

Back to TOP