LLMCaseLLMCase
Новости Кейсы рынка

Сотни треков Басты, Билана и Лазарева попали в базы для обучения нейросетей

Коротко

Треки Басты, Федука, Лазарева, Билана и «Зверей» нашлись в базах LAION-DISCO-12M и Sleeping-DISCO-9M — это каталоги на 12,3 и 9,7 млн записей. Аудиофайлов там нет, есть ссылки на стриминги, собранные инструментами, которые обходят логины и рекламу. Наличие в базе не доказывает, что на ней обучали конкретную модель. Вывод для бизнеса: всё, что выложено в открытый доступ без ограничений, попадает в чужой оборот по умолчанию.

Национальная федерация музыкальной индустрии прогнала российских исполнителей через AI Watchdog — открытый поиск по датасетам, который собрало издание The Atlantic. Результат: сотни записей на каждого.

Сколько треков российских артистов нашли в базе LAION-DISCO-12M: Баста 193, Федук 150, Лазарев 144, Билан 140
Сколько треков российских артистов нашли в базе LAION-DISCO-12M: Баста 193, Федук 150, Лазарев 144, Билан 140

В базе LAION-DISCO-12M нашлось 193 трека Басты, 150 Федука, 144 Сергея Лазарева, 140 Димы Билана, 135 группы «Звери», 119 Леонида Агутина, 99 Егора Крида. Во второй базе, Sleeping-DISCO-9M, числа поменьше: 104, 91, 118, 119, 41, 38 и 80 соответственно. Отдельно нашлись видео — 17 роликов с Лазаревым и 28 с Кридом.

Сами базы огромные. LAION-DISCO-12M — около 12,3 миллиона треков с ютуба, это примерно 91 год непрерывной музыки; собрала её немецкая некоммерческая организация LAION и выпустила в ноябре 2024 года с формулировкой «для исследовательских целей». Sleeping-DISCO-9M — около 9,7 миллиона песен плюс тексты со стороннего сайта.

Что там лежит на самом деле

Музыки в этих базах в основном нет — и без этой поправки новость читается неправильно. Есть метаданные и ссылки на ютуб и стриминги, собранные инструментами, которые обходят логины, рекламу и всё то, на чём артист обычно зарабатывает.

То есть «трек нашли в базе» означает не то, что чья-то песня лежит файлом на чужом сервере, а то, что она числится в каталоге, разосланном по рукам разработчиков.

И вторая оговорка, её даёт сам первоисточник: компании могут исключать часть материала при обучении, поэтому наличие произведения в датасете ещё не доказывает, что на нём учили модель. Расследование показывает, что ходит по рукам у разработчиков, а не кто на чём реально обучался.

Гендиректор НФМИ Никита Данилов: на текущий момент практически любой материал по-прежнему может быть использован для обучения чьей-то нейросети без разрешения автора.

Гендиректор «ON лейбла» Надежда Бойчевски добавляет, что разработчики могут активно использовать пиратские ресурсы, где не нужно ни регистрироваться, ни платить. A&R-директор S&P Digital Денис Глазин говорит, что использование профессионального контента должно быть прозрачным.

Мировая практика тем временем сдвигается: в прошлом году Warner Music договорилась с Suno, а Universal Music — с Udio. Реакции самих российских артистов и их лейблов на публикацию нет — представители Егора Крида и трёх лейблов на запрос не ответили.

Полные списки, оговорки и комментарии индустрии — в публикации «Ведомостей».

Источник: Ведомости
AI-разбор за 30 секунд
Сверим вашу нишу с внедрениями ИИ в похожие компании и покажем, где утекают заявки — за 30 секунд.
Пройти AI-разбор →
Дмитрий Кайгородов

Основатель LLMCase, делаю AI-driven маркетинг для B2B SaaS и EdTech. Подробнее об авторе →