Voila:面向实时自主交互与语音角色扮演的语音-语言基础模型
人工智能
2025-05-06 v1 计算与语言
声音
摘要
一个能无缝融入日常生活的语音AI智能体应以自主、实时且富有情感表达的方式与人类交互。它不仅仅是响应指令,而是持续倾听、推理并主动回应,从而促进流畅、动态且富有情感共鸣的交互。我们推出了Voila,这是一个大型语音-语言基础模型系列,朝着这一愿景迈出了一步。Voila超越了传统的流水线系统,采用了一种新的端到端架构,实现了全双工、低延迟的对话,同时保留了丰富的语音细微差别,如语调、节奏和情感。它实现了仅195毫秒的响应延迟,超越了人类的平均响应时间。其分层多尺度Transformer将大语言模型(LLM)的推理能力与强大的声学建模相结合,实现了自然、具有人格意识的语音生成——用户只需编写文本指令即可定义说话者的身份、语调和其他特征。此外,Voila支持超过一百万个预构建音色,并能从短至10秒的简短音频样本中高效定制新音色。除了口语对话,Voila还被设计为一个统一的模型,适用于广泛的语音应用,包括自动语音识别(ASR)、文本到语音(TTS),以及通过少量适配实现的多语言语音翻译。Voila完全开源,以支持开放研究并加速迈向下一代人机交互的进程。
引用
@article{arxiv.2505.02707,
title = {Voila: Voice-Language Foundation Models for Real-Time Autonomous Interaction and Voice Role-Play},
author = {Yemin Shi and Yu Shu and Siwei Dong and Guangyi Liu and Jaward Sesay and Jingwen Li and Zhiting Hu},
journal= {arXiv preprint arXiv:2505.02707},
year = {2025}
}
备注
18 pages, 7 figures, Website: https://voila.maitrix.org