中文

基于一致性薛inger桥的视觉引导立体声合成模型VS-Singer

声音 2025-06-23 v1 音频与语音处理

摘要

为探索利用图像中的空间线索生成带房间混响的立体声合成的潜在优势,本文引入VS-Singer—a一个视觉引导模型,用于从场景图像生成带房间混响的立体声。VS-Singer包含三个模块:首先,模态交互网络将空间特征整合到文本编码中,创建富含空间信息的语言表示;其次,解码器采用一致性薛inger桥实现一步采样生成;此外,我们利用SFE模块提高音视频匹配的一致性。据我们所知,本研究是首次将立体声合成与视觉声学匹配统一于单个框架中。实验结果表明,VS-Singer能够有效地在一步中生成与场景视角一致的立体声合成。

关键词

引用

@article{arxiv.2506.16020,
  title  = {VS-Singer: Vision-Guided Stereo Singing Voice Synthesis with Consistency Schr\"odinger Bridge},
  author = {Zijing Zhao and Kai Wang and Hao Huang and Ying Hu and Liang He and Jichen Yang},
  journal= {arXiv preprint arXiv:2506.16020},
  year   = {2025}
}

备注

Accepted by Interspeech 2025