中文

VSSFlow:通过联合学习统一视频条件声音与语音生成

音频与语音处理 2026-03-23 v4 人工智能 计算与语言 计算机视觉与模式识别 声音

摘要

视频条件音频生成(包括视频到声音(V2S)和视觉文本转语音(VisualTTS))传统上被视为独立的任务,使得统一生成框架的潜力在很大程度上未被探索。在本文中,我们通过 VSSFlow 弥补了这一空白,这是一个统一的流匹配框架,能够无缝解决这两个问题。为了在 Diffusion Transformer (DiT) 架构内有效处理多个输入信号,我们提出了一种解耦条件聚合机制,利用注意力层不同的内在特性:交叉注意力用于语义条件,自注意力用于时间密集型条件。此外,与联合训练这两个任务会导致性能下降的普遍观点相反,我们证明 VSSFlow 在端到端联合学习过程中保持了优异的性能。进一步地,我们使用了一种直接的特征级数据合成方法,证明我们的框架提供了一个稳健的基础,能够轻松适应使用合成数据的联合声音与语音生成。在 V2S、VisualTTS 和联合生成基准上的大量实验表明,VSSFlow 有效地统一了这些任务并超越了特定领域的 state-of-the-art 基线,凸显了统一生成模型的巨大潜力。项目页面:https://vasflow1.github.io/vasflow/

关键词

引用

@article{arxiv.2509.24773,
  title  = {VSSFlow: Unifying Video-conditioned Sound and Speech Generation via Joint Learning},
  author = {Xin Cheng and Yuyue Wang and Xihua Wang and Yihan Wu and Kaisi Guan and Yijing Chen and Peng Zhang and Xiaojiang Liu and Meng Cao and Ruihua Song},
  journal= {arXiv preprint arXiv:2509.24773},
  year   = {2026}
}

备注

Paper Under Review