18 сентября ’2026 10:04
Как на самом деле работает технология искусственного интеллекта в музыке
Этот переход от написанных вручную правил контрапункта к нейронным сетям, обучающимся собственным представлениям, — это не просто историческая диковинка. Он напрямую связан с тремя различными техническими подходами, лежащими в основе каждого инструмента искусственного интеллекта, используемого сегодня в музыкальном производстве. Понимание этих подходов объясняет, почему система 1957 года могла генерировать на бумаге только простые мелодии, в то время как система 2024 года может создать полностью обработанную поп-песню с вокалом менее чем за минуту.
Системы, основанные на правилах, против машинного обучения и глубокого обучения
Представьте, что вы хотите научить кого-то сочинять музыку. У вас есть три варианта. Во-первых, вы могли бы дать им учебник со строгими правилами: «никогда не двигайтесь параллельными квинтами», «разрешайте вводный тон вверх», «заканчивайте фразы на тонике». Они точно следуют инструкциям, но не могут адаптироваться, когда что-то выходит за рамки этих правил. Это система, основанная на правилах.
Во-вторых, можно было бы посадить их за стол с 500 хоралами Баха и сказать: «Выявите закономерности». Они изучат данные, заметят повторяющиеся последовательности аккордов и тенденции голосоведения, а затем применят обнаруженные закономерности для написания новых произведений. Это и есть машинное обучение.
В-третьих, вы могли бы предоставить им доступ к миллионам полных записей всех жанров, позволить им одновременно усваивать не только ноты, но и тембр, стиль аранжировки, интонацию вокала и структуру песни, а затем попросить их создать нечто совершенно новое на основе словесного описания. Это глубокое обучение, и именно оно лежит в основе моделей искусственного интеллекта для музыки, лежащих в основе современных потребительских платформ.
Каждое поколение не заменяло предыдущее в одночасье. Логика, основанная на правилах, по-прежнему работает внутри современных систем в качестве ограничителей. Распознавание образов в машинном обучении по-прежнему определяет, как организуются обучающие данные. Глубокое обучение просто добавило возможность работать с необработанным аудио в больших масштабах, а не только с символическими представлениями нот.
Как современный ИИ генерирует целые песни
Современные генераторы музыки на основе искусственного интеллекта в основном используют две архитектуры: модели трансформаторов (аналогично GPT для текста) и диффузионные модели (аналогично Stable Diffusion для изображений). Системы на основе трансформеров, такие как Suno и Udio, последовательно предсказывают аудиотокены, создавая песню шаг за шагом, подобно тому как языковая модель строит предложение слово за словом. Системы на основе диффузии, такие как Stable Audio, начинают с шума и постепенно улучшают его, превращая в связный звук, руководствуясь предоставленной вами текстовой подсказкой.
Процесс создания композиции обычно состоит из трех этапов. Вы вводите текстовое описание жанра, настроения, темпа и инструментов, иногда добавляя собственные слова или эталонный трек. Затем нейронная сеть создает песню в реальном времени, обрабатывая мелодию, гармонию, ритм и вокал за один проход. Наконец, вы экспортируете готовый трек в формате MP3 или WAV, при этом многие инструменты предлагают разделение дорожек для постобработки в DAW. Весь процесс обычно занимает от 30 до 120 секунд.
Отличие этого подхода от более ранних заключается в его полноте. Пакет программ Illiac Suite создавал ноты на бумаге, которые затем исполняли люди. EMI генерировал MIDI-данные, для которых требовался пианист. Современные системы глубокого обучения выдают готовый аудиоматериал, основанный на достаточно обширных данных для обучения музыке, позволяющих кодировать как методы создания музыки, так и композиционные приемы.
Обучающие данные и чему на самом деле учится ИИ
Когда вы слышите, что модель искусственного интеллекта для работы с музыкой была «обучена на миллионах песен», что это на самом деле означает? Система не запоминает треки и не воспроизводит их заново. Вместо этого она обрабатывает аудио, преобразованное в числовые представления, спектрограммы, мел-частотные характеристики или токенизированные аудиокоды, и изучает статистические взаимосвязи между этими числами.
На основе миллионов примеров модель изучает, какие последовательности аккордов обычно следуют друг за другом в поп-музыке, как куплет переходит в припев, какие частотные характеристики определяют искаженное звучание гитары и чистое звучание фортепиано, а также как вокал располагается в миксе относительно ударных и баса. Она создает внутреннюю карту музыкальных возможностей, не сохраняя ни одной песни дословно.
Важное различие существует между источниками обучения. Некоторые платформы, такие как SOUNDRAW и Mubert, обучаются исключительно на собственных записях, сделанных внутри компании, что полностью исключает конфликты из-за авторских прав. Другие, например Suno, обучаются на общедоступной музыке, что вызвало продолжающиеся юридические дебаты о добросовестном использовании и вознаграждении артистов. Выбор обучающих данных определяет не только юридический статус инструмента, но и его звуковой диапазон и возможности работы с различными жанрами.
Именно эта техническая основа, разрыв между следованием правилам и обучением на основе больших объемов данных, позволила искусственному интеллекту в музыкальном производстве совершить скачок от академического любопытства к общедоступному творческому инструменту. Этот скачок в возможностях не был постепенным. Он произошел концентрированным всплеском, когда глубокое обучение достаточно созрело для обработки аудио, и этот всплеск изменил всю картину того, кто может создавать музыку и как.
Эра глубокого обучения и расцвет потребительского ИИ в музыкальной индустрии
Этот концентрированный всплеск происходил поэтапно. Сначала были научные прорывы в хорошо финансируемых лабораториях. Затем появились стартапы, которые воплотили эти прорывы в продукты. И наконец, всего за несколько лет, появились платформы, которые предоставили возможность полноценного создания музыки любому, у кого есть вкладка в браузере и идея.
Прорывы в глубоком обучении, изменившие всё
Google запустила своюпроект «Маджента» В 2016 году компания Magenta запустила проект с открытым исходным кодом, специально ориентированный на использование машинного обучения для создания произведений искусства и музыки. Magenta предоставила исследователям свободно доступные инструменты для экспериментов с генерацией мелодий, аккомпанементом и синтезом звука, заложив основу для экосистемы академических и независимых проектов, построенных на инфраструктуре Google.
В 2019 году OpenAI выпустила MuseNet — глубокую нейронную сеть, способную генерировать четырехминутные композиции с использованием до десяти различных инструментов. MuseNet работала в символической области, предсказывая MIDI-подобные токены, но могла смешивать стили, которые никогда ранее не сочетались: Шопен в сочетании с поп-музыкой или Моцарт в сочетании с джазом. Затем, в апреле 2020 года, OpenAI выпустила Jukebox, что представляло собой гораздо более амбициозный шаг вперед. Jukebox генерировала необработанный аудиофайл напрямую, включая элементарное пение, с учетом жанра, стиля исполнителя и текста песни. Она обучалась на 1,2 миллионах песен и использовала иерархическое сжатие VQ-VAE в сочетании с разреженными трансформерами для обработки экстремально длинных последовательностей, необходимых для необработанного аудио. Рендеринг одной минуты аудио занимал примерно девять часов, что делало ее непрактичной для использования в реальном времени, но доказательство концепции было неоспоримым: ИИ мог создавать нечто, звучащее как полноценная песня, включая вокал.
Это были не потребительские товары. Это были демонстрации результатов исследований. Но они показали всей технологической индустрии, что теперь технически возможно, и венчурный капитал обратил на это внимание.
Взрыв потребительских платформ
В период с 2016 по 2024 год целая волна компаний, занимающихся разработкой искусственного интеллекта для создания музыки, преобразовала эти научные прорывы в доступные инструменты. Каждая платформа заняла свою нишу, от лицензирования фоновой музыки до полноценного создания песен:
2016 год — запуск AIVA, первоначально ориентированной на создание классической и кинематографической музыки с использованием глубокого обучения, обученного на тысячах классических произведений.
2017 год — дебютирует Amper Music (позже приобретенная Shutterstock в 2020 году), предлагающая настраиваемые бесплатные музыкальные треки для создателей видеоконтента.
2019 год — Mubert запускает потоки генеративной музыки в реальном времени, смешивая созданные человеком лупы с аранжировкой, выполненной искусственным интеллектом.
2020 год — Запуск Boomy, позволяющего пользователям создавать и распространять песни на стриминговых платформах с минимальным участием.
2020 год — Запуск SOUNDRAW, обучающей программы, работающей исключительно с авторскими записями, во избежание проблем с авторскими правами.
Июль 2023 г. — Suno запускается в Discord, быстро становясь самой быстрорастущей платформой в этой сфере.
Апрель 2024 г. — Udio выходит на публичный рынок. Компания основана бывшими исследователями Google DeepMind при поддержке a16z.
Если вас интересовало, когда появился Suno AI, ответ — в середине 2023 года на Discord, а вскоре после этого вышла и веб-платформа. С тех пор бренд Suno стремительно развивался. Данные Semrush показывают, что Suno привлекал 46,9 миллионов ежемесячных посещений примерно за 18 месяцев после запуска, что сделало его одной из самых посещаемых креативных платформ на основе ИИ в мире. Объединенная экосистема Suno, Udio и их конкурентов теперь обслуживает миллионы активных пользователей, ежедневно создающих песни.
От исследовательских лабораторий до браузера каждого
Итак, сколько же существует музыкантов, использующих ИИ? Точное число определить сложно, но масштабы поражают. Только на платформе Boomy к 2023 году было создано более 20 миллионов песен. Данные Suno о посещаемости указывают на миллионы активных создателей контента ежемесячно. Deezer сообщила, что почти 40 процентов ежедневных загрузок на её платформу теперь полностью генерируются ИИ. Если добавить к этому любителей экспериментировать, профессиональных продюсеров, использующих ИИ для создания отдельных дорожек или аранжировок, и создателей контента, генерирующих фоновые треки, то общее сообщество легко достигает десятков миллионов человек по всему миру.
Почему эта эпоха ощущается как революция, если её основы уходят корнями почти на семь десятилетий назад? Разрыв между созданием MIDI-мелодии и получением отполированной трёхминутной песни с подходящим для жанра вокалом, инструментами, сведением и мастерингом огромен. Более ранние системы создавали наброски, которые требовали участия исполнителей и звукорежиссёров, чтобы стать пригодными для прослушивания. Сегодняшние платформы предоставляют готовый аудиоматериал. Этот переход от «интересного академического результата» к «тому, что вы действительно добавите в плейлист» отличает Suno и Udio от Illiac Suite, хотя обе платформы основаны на одном и том же ключевом принципе: позволить машинам принимать композиционные решения.
Рынок музыки, созданной с помощью ИИ, достиг 5,2 миллиарда долларов США в 2024 году и, по прогнозам, вырастет до 60,4 миллиарда долларов США к 2034 году. Музыкальные стартапы привлекли более 700 миллионов долларов США только за первую половину 2025 года. Компания Suno привлекла 250 миллионов долларов в рамках раунда финансирования серии C в ноябре 2025 года. Это не исследовательские гранты, финансирующие академические исследования. Это венчурный капитал, делающий ставку на то, что создание музыки с помощью ИИ станет постоянной, массовой творческой категорией.
При таких огромных суммах денег, таком количестве пользователей и таком объеме творческой продукции, циркулирующей на этих платформах, влияние на существующую музыкальную индустрию было неизбежным. Известные артисты, лейблы и правовые системы должны были отреагировать, и их реакция показывает, насколько глубоко искусственный интеллект уже изменил то, кто и на каких условиях создает музыку.
|
|