ШІ-компанії скуповують книги та знищують їх заради навчання моделей

Розробники штучного інтелекту (зокрема Anthropic та Amazon) скуповують паперові й рідкісні книги для їхнього деструктивного оцифрування та використання догенеративних текстів у навчанні мовних моделей.
4 Жовтня, 20:04

Компанії, що розробляють штучний інтелект, дедалі активніше купують паперові книги великими партіями, щоб оцифровувати їхній вміст для навчання мовних моделей. У деяких випадках після сканування примірники фізично знищують, оскільки книги розбирають для швидкого автоматизованого сканування.

Причина такого попиту – якість паперових видань як джерела даних. Значна частина книжок, особливо академічних і спеціалізованих, не має доступної цифрової версії. Водночас тексти, написані й відредаговані людьми до масового поширення генеративного ШІ, вважаються цінним матеріалом для тренування моделей.

Окремо відомий випадок пов’язаний з Anthropic. Судові документи показали, що компанія придбала мільйони друкованих книг і використовувала так зване destructive scanning – у примірників зрізали палітурки, сторінки пропускали через швидкісні сканери, а паперові оригінали після цього утилізували. Суддя визнав придбання та сканування легально придбаних книг для внутрішнього навчання моделей допустимим у межах доктрини fair use.

У 2026 році подібна практика привернула ще більше уваги після розслідувань щодо Amazon. Журналісти простежили шлях придбаної рідкісної книги до складу компанії в Лас-Вегасі, де її розібрали та відсканували.

Водночас не кожна масова закупівля означає подальше знищення книг. Саме це робить проблему суперечливою: технологічна потреба в якісних даних стикається з питаннями авторського права, збереження культурної спадщини та доступу до рідкісних видань.

Читайте також