ИИ-компании уничтожают книги после оцифровки ради обучения нейросетей
Пиратские копии уходят в прошлое — теперь нужны оригиналы.
Компания Anthropic, разработчик семейства языковых моделей Claude, урегулировала судебный спор, который может повлиять на всю индустрию искусственного интеллекта. В рамках дела суд признал добросовестным использование защищённых авторским правом материалов для обучения ИИ при определённых условиях, однако сам процесс подготовки данных вызвал новый скандал.
Из материалов дела стало известно, что Anthropic закупала большое количество книг у перекупщиков, после чего использовала промышленную гидравлическую режущую машину для аккуратного отделения страниц от обложек и последующего сканирования. Полученные цифровые копии применялись для обучения языковых моделей.
Такой подход позволяет компаниям избежать одной из главных проблем — использования пиратских библиотек с неизвестным происхождением. Однако он породил другую проблему: физические экземпляры книг после оцифровки уничтожаются, а среди них могут оказаться редкие и антикварные издания. Компании при этом не готовы ни подтверждать, ни опровергать, что такие экземпляры попадают под переработку.
Дополнительную сложность для ИИ-индустрии создаёт рост количества материалов, созданных с помощью генеративных моделей. После 2022 года такого контента стало значительно больше, но его использование для обучения новых моделей может привести к так называемому модельному коллапсу — постепенному накоплению ошибок и снижению качества результатов. Кроме того, художники и писатели начали экспериментировать с «отравлением данных», создавая материалы, которые могут нарушить работу ИИ.
Одним из факторов, повлиявших на появление этого движения, стали исследования самой Anthropic. Компания показала, что даже небольшое количество очень продуманных данных среди огромного массива информации способно создать уязвимость в крупной языковой модели.
Стартап ISBNdb, который занимается созданием крупнейшей базы данных книг для ИИ-компаний, рассказал о случаях, когда подобные методы уже вводили ИИ в заблуждение. Например, группа художников загрузила около трёх тысяч модифицированных изображений собак, из-за чего некоторые модели начали воспринимать их как изображения кошек.
По данным 404 Media, закупка книг, выпущенных до 2022 года, стала распространённой практикой среди ИИ-компаний. Перекупщики при этом начали активно пользоваться растущим спросом, а ISBNdb помогает лабораториям приобретать партии от нескольких тысяч до миллиона книг.
При этом покупателям обещают конфиденциальность, поскольку компании не хотят становиться героями скандальных публикаций. После оцифровки книги зачастую просто уничтожаются, независимо от того, являются ли они массовыми изданиями или редкими экземплярами.
Анонимный продавец рассказал 404 Media, что в апреле 2026 года его продажи выросли с примерно 20 книг в неделю до нескольких сотен. По его словам, покупатели используют базы ISBN, поэтому он уверен, что значительная часть спроса связана с ИИ-лабораториями. Особенно его беспокоит судьба редких книг, которые могут исчезнуть после покупки.
404 Media также сообщило, что некоторые букинистические магазины в Нидерландах получили большое количество оптовых заказов. Владельцы подозревают, что за этим стоят компании, работающие с искусственным интеллектом, однако подтвердить это невозможно, поскольку посредники скрывают информацию о клиентах.
Ещё больше историй — на YouTube-канале Molwe. Эксклюзивные интервью, документальные фильмы и многое другое. Подписывайтесь!
