A la IA le falta alimento. Las Grandes Tecnológicas Compran y Destruyen Millones de Libros

PUBLICADO: 2026-08-08ACTUALIZADO: 2026-08-19
AUTOR: Manuel PrietoREVISADO POR: Manuel Prieto
Inteligencia-artificial

La web abierta se satura de texto autogenerado. Millones de páginas replican a diario los mismos moldes predecibles convirtiendo la red en un cubo de basura, generando AI SlopGlosarioAI SlopTérmino que define la morralla, bazofia o contenido basura generado en masa por modelos de inteligencia artificial sin supervisión ni valor editorial. Proviene del inglés slop (literalmente la comida de desperdicios o sobras que se echa a los cerdos). En la cultura digital representa el sucesor directo del spam: textos inflados, imágenes clónicas, código genérico y relleno algorítmico sin criterio ni alma que saturan internet y provocan el colapso de los propios modelos al retroalimentarse de su propia basura.Ver término completo →. Texto que retroalimenta la misma IA que le da más autoridad sin tener en cuenta realmente bibliografía real, humana.

Entrenar un modelo con texto generado por otro modelo desata el Model CollapseGlosarioModel CollapseDegeneración progresiva y pérdida irreversible de calidad que experimenta un modelo de lenguaje o de inteligencia artificial cuando se entrena con datos generados por otros modelos en lugar de contenido producido por humanos. Al alimentarse de su propia producción sintética, el algoritmo amplifica los sesgos estadísticos, empobrece su riqueza léxica y colapsa su capacidad de razonamiento.Ver término completo → (Colapso del Modelo). El algoritmo digiere sus propios tics estadísticos. Amplifica errores, recorta vocabulario y degrada su capacidad de razonamiento lógico.

Cuanto más texto genera internet por segundo, menos sirve para entrenar IA. La web abierta carece de novedad lingüística. Para que los modelos sigan escalando sin degradarse, los laboratorios necesitan redacción humana original, libre de contaminación algorítmica.

Estudio de Epoch AI: El Muro de Datos

En su investigación Will we run out of data? Limits of LLM scaling based on human-generated data, el instituto de investigación Epoch AI calcula que el stock global efectivo de texto humano público de alta calidad ronda los 300 billones de tokens (300 trillion tokens). Al ritmo de consumo actual, los modelos agotarán esta reserva entre 2026 y 2032 (o antes ante sobreentrenamientos agresivos). Por ello, los laboratorios han salido a comprar bibliotecas enteras de libros impresos anteriores a 2022 y a cerrar acuerdos millonarios con editoriales científicas.

El Escaneo Destructivo de Libros Físicos y la Doctrina de Primera Venta

El año 2022 marca la frontera crítica. Cualquier texto publicado a partir de esa fecha corre el riesgo de haber sido redactado o retocado por un modelo de lenguaje. Los libros físicos impresos antes de 2022 ofrecen una garantía que ningún repositorio digital puede prometer. Garantizan redacción humana 100% libre de residuos algorítmicos.

Para sortear las demandas por copyright tras el uso de bibliotecas digitales piratas como Books3 (caso que forzó indemnizaciones millonarias), empresas como Anthropic, Meta y otros gigantes del sector recurrieron al mercado físico secundario.

Compra Masiva a Granel01

Intermediarios como ISBNdb gestionan pedidos confidenciales de entre 1.000 y 1.000.000 de libros usados por encargo para laboratorios de IA, vaciando inventarios enteros de librerías de viejo y fondos descatalogados.

Guillotinado y Escaneo02

Máquinas hidráulicas cortan los lomos de cuajo. Las hojas sueltas pasan por escáneres industriales a miles de páginas por minuto, transformando la celulosa en texto digital de alta densidad.

Triturado y Blindaje Legal03

Tras digitalizarlas, el papel se destruye de inmediato. Esta maniobra elimina los costes de almacenar millones de tomos y permite acogerse a la doctrina de primera venta (First-Sale Doctrine), defendiendo que cada copia digital procede de un ejemplar físico legítimamente adquirido y destruido tras su uso formativo.

Paralelamente, las editoriales académicas vieron una oportunidad de negocio directa. Sellos como Wiley, Taylor & Francis o Informa han cerrado acuerdos de licencia de contenidos que oscilan entre los 10 y los 30 millones de dólares, suministrando acceso directo a millones de artículos científicos, tesis y monografías con un nivel de densidad conceptual inalcanzable en la web abierta.

Sin embargo, devorar papel analógico es una solución de fuerza bruta con fecha de caducidad. Los libros impresos no son infinitos. Acelerar el consumo físico solo posterga la colisión contra el Muro de Datos.

Por Qué las Soluciones Actuales en IA se Quedan Cortas

Comprar y escanear libros físicos solo gana tiempo. La alternativa técnica exige intervenir directamente en cómo el modelo elige cada palabra al redactar o reajustar su entrenamiento para erradicar las muletillas. Sin embargo, los métodos actuales para frenar estos clichés fracasan o provocan fallos peores.

Intentar suprimir clichés mediante prohibiciones directas suele empeorar el resultado. Los modelos de lenguaje no procesan palabras completas, sino fragmentos (sub-tokens). Si un filtro veta una palabra como incalculable, el bloqueo probabilístico puede castigar los sub-tokens que la forman (in-, calcul-, -able), inutilizando términos legítimos y cotidianos como el verbo calcular. Este daño colateral rompe la gramática y fuerza a la máquina a recurrir a sinónimos rebuscados.

Además, vetar conceptos en el prompt desata el efecto rebote (backfire effect). Si se ordena al modelo "no hables del futuro de la tecnología ni uses la palabra revolucionario", la atención del Transformer sitúa un peso probabilístico alto sobre esos términos prohibidos. El algoritmo intenta esquivarlos, pero termina redactando rodeos forzados como "sin caer en pronósticos futuristas ni cambios revolucionarios..." o saturando el texto de conceptos limítrofes. La restricción explícita en el prompt funciona como un imán temático en lugar de un filtro real.

Para entender por qué la industria no logra erradicar el slop, los investigadores Allen Roush y Parag Mahajani de Thoughtworks AI Labs publicaron un estudio comparativo (Anti-slopping: An innovation for rectifying LLM writing clichés).

Su análisis recopila las estrategias actuales para mitigar la repetición de patrones y detalla las limitaciones técnicas (shortcomings) de cada una.

EstrategiaLimitaciones Técnicas (Shortcomings)
1Top-k, top-p y min-pNo resuelven las tendencias repetitivas en generaciones coherentes.
2RLHF (Alineación humana)Proceso lento y con baja productividad en la supresión de patrones.
3Exclude Top Choices (XTC)Solo actúa sobre tokens aislados de muy alta probabilidad.
4Don't Repeat Yourself (DRY)Incapaz de identificar patrones repetitivos que emergen a nivel estadístico.
5String Banning (función de ExLlama)Bloqueo estricto (hard-ban) de cadenas predefinidas en tiempo de inferencia.
6Beam SearchExcluye palabras o frases prohibidas mediante poda de ramas (beam pruning).
7Direct Preference Optimization (DPO)Reduce la probabilidad de respuestas preferidas, provocando colapso de diversidad y recortando variedad sintáctica y n-gramas.

Las Tres Fases del Framework Anti-slop de Thoughtworks

Frente al callejón sin salida de la fuerza bruta y los filtros rígidos, Thoughtworks AI Labs diseñó un framework capaz de eliminar hasta 8.000 patrones sin degradar la capacidad del modelo ni provocar daños colaterales. Su arquitectura se articula en tres fases.

  1. Pipeline Automatizado de Detección. Calcula la ratio de frecuencia entre las salidas del modelo y corpus humanos de referencia (wordfreq, Reddit y Proyecto Gutenberg) para aislar patrones sobreutilizados (como "tapestry of color").
  2. Anti-slop Sampler con Retroceso (Backtracking). Al detectar el cliché en inferencia, frena la generación, retrocede los tokens afectados y fuerza al modelo a elegir alternativas naturales ("cascade", "brilliant", "crimson"), generando un dataset de pares preferentes.
  3. FTPO (Final Token Preference Optimization). Algoritmo de entrenamiento ligero que interviene únicamente en el token exacto de decisión. Reajusta los logits con penalizaciones suaves (soft-touch), logrando hasta un 90% de reducción de clichés sin penalizar la velocidad de respuesta ni el razonamiento lógico.

Comparativa de Rendimiento FTPO frente a DPO

En pruebas sobre modelos Gemma-3-12b con listas de 1.000 a 8.000 patrones prohibidos, los resultados demuestran por qué los métodos habituales degradan el texto mientras FTPO lo preserva.

Parámetro EvaluadoFTPO (Thoughtworks)DPO Tradicional
Eficacia de SupresiónSuprime entre el 85% y 90% del slop (+8.5% mejor).Suprime un 80-82% antes de degradarse bruscamente.
Calidad de EscrituraMantiene la calidad inicial intacta (puntuación ~78/100).Caída severa de calidad (cae de 78 a 15/100 al subir exigencia).
Diversidad LéxicaMantiene o incrementa el vocabulario (95-102%).Provoca un colapso progresivo de palabras y n-gramas (74-92%).
Razonamiento y MatemáticasPreserva GSM8k y MMLU dentro del 1-3% del modelo original.Degrada las capacidades de razonamiento general entre un 2% y 5%.
Analogía del GPS y el desvío de atascos frente al retroceso de inferencia

El dilema de navegación y rutas predeterminadas

  • Backtracking — El vehículo entra en el atasco, detecta la retención, retrocede marcha atrás y busca otra salida. Esquiva el cuello de botella, pero penaliza el tiempo de llegada.
  • DPO tradicional — Bloquea avenidas enteras en el mapa. El navegador evita el atasco a costa de desorientarse, ignorar atajos y avanzar a tirones.
  • FTPO — Reajusta el mapa en el cruce exacto. El sistema gira a la derecha justo antes de entrar a la retención y sostiene la marcha a velocidad máxima.

El código del muestreador y los conjuntos de datos de entrenamiento están disponibles con licencia abierta en GitHub en el repositorio sam-paech/auto-antislop.

Guía Práctica Complementaria

Para detectar y limpiar estos patrones en borradores editoriales, consulta la guía AI SLOP. Smells like AI Spirit. ¿Por qué mis textos saben y huelen a IA? →

Preguntas Frecuentes

Bibliografía y Fuentes de Referencia