Des millions de livres sont détruits pour entraîner des IA
Ce contenu est une adaptation de mon post LinkedIn du 10/09/2026.
[Les ravages des IA génératives, épisode 18427]
Depuis des années, Anthropic et Amazon détruisent des millions de livres pour entraîner leurs IA génératives.
Et on ne peut rien y faire.
Pourquoi s’en prendre aux livres ?
Parce que ce sont des contenus de qualité, dont le contenu est considéré comme fiable.
Autre avantage : les livres parus avant 2021/2022 sont garantis sans IA.
Ils ne sont pas fous chez Amazon et Anthropic : ils ne vont quand même pas entraîner leurs modèles avec les contenus pourris générés par leurs IA !
On peut aussi y voir un symbole : détruire les anciennes sources de savoir pour mieux les remplacer par les nouvelles.
En outre, ils semblent s’attaquer spécifiquement à des ouvrages rares, les rendant introuvables après leur destruction.
Or, il y a deux façons de scanner un livre :
- Ouvert, en scannant les pages une par une. Cette méthode non destructive est notamment utilisée par Google avec Google Books.
- En tranchant la reliure et en scannant les pages à une cadence industrielle. Cette méthode est plus rapide que la précédente car il ne faut pas tourner les pages une par une. En revanche, elle détruit les livres.
L’objectif est clair : faire vite, pour pas cher. Au diable la culture et le bien commun… Sans compter les problèmes de droit d’auteur liés à ce pillage.
Le pire c’est que cette pratique semble légale (aux États-Unis du moins). Il ne semble donc pas y avoir de moyens de l’empêcher.
Moi aussi. Tous mes contenus sont rédigés sans IA générative, pour être lus par des humains.
À lire ensuite :
Sources :
- Article de Numerama
- Enquête de 404 media (vidéo en anglais)