Клонує будь-який голос за 10-секундним аудіосемплом, голос агента залишається ідентичним оригіналу всю розмову
Відповідає місо за 110мс, можна сказати ріалтайм
На бекбоні у неї flama-8B (Llama 3.2-style) та аудіо декодер flama-300M, головний мінус що мова тільки англійська
Спробувати – демоспейс
HuggingFace
Github
Сайт - тут можна потестувати прямо на головній сторінці
smaller consumer GPUs (4–16 GB) are not sufficient for the full model.😒
"головний мінус що мова тільки англійська" думаю це плюс бо я вже бачу схемки розводняків, які загалом навіть уже існують але з цим стануть в рази простіше реалізуємими...