Технологическая компания Microsoft сообщила о разработке особого инструмента, способного создать имитацию любого голоса — достаточно будет аудиозаписи длительностью всего в три секунды. Решение получило название VALL-E — отсылая к главному персонажу-роботу одноименного мультфильма.
Специалисты, участвовавшие в создании этой модели искусственного интеллекта, гарантируют воспроизведение абсолютно любого голоса. Будут продублированы не только сугубо аудиальные особенности, как высота и тембр, но и эмоциональная окраска.
Архитектура VALL-E базируется на нейронной языковой модели, за основу которой взят аудиокодировщик EnCondec. Цельный голосовой образец разделяется на отдельные составные части — лексемы. Затем эти компоненты сопоставляются нейросетью с аналогичными голосами, заданными в обучающих данных. Создаются новые фразы.
Код VALL-E не был запущен компанией Microsoft в открытый доступ, несмотря на то что разработка представлена на GitHub. Разработчики объясняют это присутствием рисков неправильного использования модели: замену реального голоса на фейк при идентификации, выдачу себя за другого человека.
