PerformSinger:基于同步舞台化妆线索的人类合唱语音合成
音频与语音处理
2025-09-30 v1 多媒体
声音
摘要
现有的合唱语音合成(SVS)模型主要依赖细粒度的音素级时长,这限制了其实际应用。这些方法忽略了视觉信息在时长预测中的补充作用。为此,我们提出PerformSinger,一个 pioneering 多模态 SVS 框架,融合来自舞台化妆视频的唇部线索作为视觉模态,实现高质量“无时长”合唱语音合成。PerformSinger 包括平行的多分支多模态编码器、特征融合模块、时长与变分预测网络、mel 频谱解码器和声码器。融合模块由适配器和融合块组成,采用在对齐语义空间内的渐进式融合策略,以生成高质量的多模态特征表示,从而实现精准的时长预测和高保真度音频合成。为便于研究,我们设计、收集并标注了一个新型 SVS 数据集,涉及同步视频流和精确的音素级手动标注。大量实验表明,我们的提案在主观和客观评估中均实现了 state-of-the-art 的性能。代码和数据集将公开提供。
引用
@article{arxiv.2509.22718,
title = {PerformSinger: Multimodal Singing Voice Synthesis Leveraging Synchronized Lip Cues from Singing Performance Videos},
author = {Ke Gu and Zhicong Wu and Peng Bai and Sitong Qiao and Zhiqi Jiang and Junchen Lu and Xiaodong Shi and Xinyuan Qian},
journal= {arXiv preprint arXiv:2509.22718},
year = {2025}
}