



ИИ-компании начали скупать старые книги из-за нейрослопа в сети
Компания ISBNdb объявила о создании «крупнейшей в мире базы данных книг» и предлагает услуги по закупке больших объёмов печатной продукции для компаний, занимающихся ИИ. Это позволит разработчикам избежать обучения искусственного интеллекта на нейрослопе, объясняют авторы проекта.
«Лучшие в мире обучающие данные для ИИ лежат на полке. Книги представляют собой тщательно отобранные, прошедшие экспертную оценку, специализированные знания, структурированные таким образом, что ни один веб-сканер не сможет их воспроизвести», — говорится на сайте ISBNdb.
Авторы проекта объясняют, что печатные книги, изданные до 2022 года, идеально подходят для обучения ИИ, поскольку они не содержат сгенерированного текста. Как справедливо отмечается в статье, большая часть данных, которые можно извлекать из интернета, вероятно, будет включать текст, сгенерированный ИИ, что может привести к «коллапсу модели».
ISBN расшифровывается как Международный стандартный книжный номер (ISBN), это числовой коммерческий идентификатор книги и штрихкод на обороте большинства книг. В течение многих лет ISBNdb помогала продавцам книг, библиотекам и дистрибьюторам управлять своими запасами, находить и продавать книги, но бум генеративного ИИ сделал её ценным инструментом для компаний. Помимо продажи доступа к метаданным книг, ISBNdb теперь помогает лабораториям ИИ закупать печатные книги оптом, от 1000 до 1 млн экземпляров за заказ. Данные ISBNdb упрощают компаниям, занимающимся ИИ, методичный сбор, сканирование и преобразование печатных книг в обучающие данные, избегая при этом дублирования.
ISBNdb рекламирует свою способность сохранять в тайне данные компаний, занимающихся искусственным интеллектом. «Строгое соглашение о неразглашении информации (NDA) на каждом
Читать на habr.com