Компании, разрабатывающие искусственный интеллект, все более активно покупают бумажные книги большими партиями, чтобы оцифровывать их содержимое для обучения языковым моделям. В некоторых случаях после сканирования экземпляры физически уничтожают, поскольку книги разбирают для быстрого автоматизированного сканирования.
Причина такого спроса – качество бумажных изданий как источника данных. Значительная часть книг, особенно академических и специализированных, не имеет доступной цифровой версии. В то же время тексты, написанные и отредактированные людьми для массового распространения генеративного ИИ, считаются ценным материалом для тренировки моделей.
Отдельно известный случай, связанный с Anthropic. Судебные документы показали, что компания приобрела миллионы печатных книг и использовала так называемый destructive scanning – у экземпляров срезали переплеты, страницы пропускали через скоростные сканеры, а бумажные оригиналы после этого утилизировали. Судья признал приобретение и сканирование легально приобретенных книг для внутреннего обучения моделей допустимым в рамках доктрины fair use.
В 2026 году подобная практика привлекла еще большее внимание после расследований по Amazon. Журналисты проследили путь приобретенной редкой книги в состав компании в Лас-Вегасе, где ее разобрали и отсканировали.
В то же время, не каждая массовая закупка означает дальнейшее уничтожение книг. Это делает проблему противоречивой: технологическая потребность в качественных данных сталкивается с вопросами авторского права, сохранения культурного наследия и доступа к редким изданиям.
Читайте также


