Vevo2:面向语音与合成音的统一可控框架
声音
2026-03-06 v3 人工智能
计算与语言
摘要
可控人声生成,特别是针对如合成音这样的表达性领域,仍然是一个重要挑战。本文介绍了 Vevo2,一个用于可控语音和合成音生成的统一框架。为解决语音-合成音标注数据稀缺问题以及实现灵活可控性,Vevo2 引入了两个音频标记器:(1)一个无音标的统一乐谱记号化器,捕获来自语音、合成音乃至乐器声音的韵律与旋律;(2)一个统一的内容-风格标记器,为语音和合成音编码语言内容、韵律与风格,同时实现声音特性解耦。Vevo2 包含一个自回归(AR)内容-风格建模阶段,旨在实现对文本、韵律和风格的可控性,以及一个流匹配声学建模阶段,允许声音特性可控。特别地,在语音-合成音联合训练期间,我们提出了显式和隐式的韵律学习策略,以桥接语音和合成音。此外,为进一步增强 Vevo2 遵循文本和韵律的能力,我们设计了一个多目标后训练任务,整合了可读性和韵律相似性对齐。实验结果表明,Vevo2 中的统一建模对语音和合成音生成都带来了相互的益处。此外,Vevo2 在广泛的合成、转换和编辑任务中效果出色,进一步证明了其强大的泛化能力和通用性。音频样本可在 https://versasinger.github.io/ 查看。
引用
@article{arxiv.2508.16332,
title = {Vevo2: A Unified and Controllable Framework for Speech and Singing Voice Generation},
author = {Xueyao Zhang and Junan Zhang and Yuancheng Wang and Chaoren Wang and Yuanzhe Chen and Dongya Jia and Zhuo Chen and Zhizheng Wu},
journal= {arXiv preprint arXiv:2508.16332},
year = {2026}
}
备注
Accepted by the IEEE Transactions on Audio, Speech and Language Processing (TASLP)