Минулого тижня весь інтернет гудів про те, що ElevenLabs запустила ШІ-генератор звукових ефектів за текстовим описом.
Слідом за ними StabilityAI анонсували свій новий продукт - Stable Audio Open, модель з відкритим вихідним кодом, оптимізовану для генерації коротких аудіо-семплів, звукових ефектів та елементів продакшну за допомогою текстових підказок.
Твіттер аккаунт компанії прокоментував подію так:
Цей реліз знаменує собою важливу віху на шляху до подальшого відкриття частини наших можливостей генерації звуку, щоб розширити можливості саунд-дизайнерів, музикантів та творчих спільнот.
Ентузіасти вже встигли зробити декілька спейсів, де можна протестувати нову модель:
Що таке Stable Audio Open?
Stable Audio Open дозволяє будь-кому генерувати до 47 секунд високоякісних аудіоданих з простої текстової підказки. Він ідеально підходить для створення барабанних ударів, інструментальних рифів, звуків навколишнього середовища, фолейних записів та інших аудіо-семплів для музичного продакшну та саунд-дизайну.
Ключова перевага цього релізу з відкритим вихідним кодом полягає в тому, що користувачі можуть тонко налаштовувати модель на основі власних аудіоданих. Наприклад, барабанщик може налаштувати модель на основі семплів власних записів барабанів, щоб створити нові удари.
Музика в стерео, а птахи в моно
@romanserhiyovych в моно кіт