中文

听声是否能助于看图?探究音视频联合去噪对视频生成的影响

计算机视觉与模式识别 2025-12-04 v2

摘要

近期音视频生成系统表明,多模态耦合不仅有助于音视频同步,还能提升视频模态本身的表现。我们提出一个根本性问题:即使我们只关心视频质量,音视频联合去噪训练是否能改进视频生成?为此,我们引入一种参数高效的Audio-Video Full DiT(AVFullDiT)架构,利用预训练的文本到视频(T2V)和文本到音频(T2A)模块进行联合去噪。我们分别在相同设置下训练(i)一个T2AV模型使用AVFullDiT,和(ii)一个仅用于T2V的模型。我们的结果首次系统性地证明,音视频联合去噪的确能带来超越同步的收益。我们观察到在包含大幅运动和物体碰撞运动的具挑战性子集上表现持续提升。我们推测,预测音频作为特权信号(privileged signal),可鼓励模型内在化视觉事件及其声学后果(如碰撞×冲击声)之间的因果关系,从而正则化视频动态。我们的发现表明,跨模态联合训练是开发更强大、更具物理依据的世界模型的有前景的途径。代码和数据集将公开释放。

关键词

引用

@article{arxiv.2512.02457,
  title  = {Does Hearing Help Seeing? Investigating Audio-Video Joint Denoising for Video Generation},
  author = {Jianzong Wu and Hao Lian and Dachao Hao and Ye Tian and Qingyu Shi and Biaolong Chen and Hao Jiang and Yunhai Tong},
  journal= {arXiv preprint arXiv:2512.02457},
  year   = {2025}
}

备注

Project page at https://jianzongwu.github.io/projects/does-hearing-help-seeing/