Створити

Нова open-sourse SOTA tts від Miso Labs, маленька, спритна, якісна, спрямована н

Клонує будь-який голос за 10-секундним аудіосемплом, голос агента залишається ідентичним оригіналу всю розмову

Відповідає місо за 110мс, можна сказати ріалтайм

На бекбоні у неї flama-8B (Llama 3.2-style) та аудіо декодер flama-300M, головний мінус що мова тільки англійська

Спробувати  – демоспейс
HuggingFace 
Github 
Сайт - тут можна потестувати прямо на головній сторінці

2 коментарі

Увійдіть, щоб коментувати.
1 бал
Поскаржитись

smaller consumer GPUs (4–16 GB) are not sufficient for the full model.😒

1 бал
Поскаржитись

"голов­ний мінус що мова тіль­ки англійська" думаю це плюс бо я вже бачу схемки розводняків, які загалом навіть уже існують але з цим стануть в рази простіше реалізуємими...