时间上的回响:解锁视频到音频生成模型的长度泛化
计算机视觉与模式识别
2026-04-16 v3 人工智能
摘要
视频和音频之间的多模态对齐在规模化方面具有挑战性,特别是由于数据有限以及文本描述与帧级视频信息之间的不匹配。在本工作中,我们针对多模态到音频生成中的规模化挑战,探讨了在测试期间是否可以从处理短实例的模型推广到处理更长实例。为解决这一挑战,我们提出了多模态层次网络,称为 MMHNet,是最先进的视频到音频模型的一个增强扩展。我们的方法集成了层次方法和非因果 Mamba,以支持长时段音频生成。我们提出的方法显著提高了长音频生成能力,最长可达超过 5 分钟。我们也证明了在视频到音频生成任务中,仅通过训练短时段即可在测试时生成更长的音频是可能的。在我们的实验中,我们的方法在长视频到音频基准测试上取得了显著的成绩,超越了以往在视频到音频任务中的工作。此外,我们展示了我们的模型在生成超过 5 分钟内容方面的能力,而以往的视频到音频方法在生成长时段内容方面一tures shortcoming。
引用
@article{arxiv.2602.20981,
title = {Echoes Over Time: Unlocking Length Generalization in Video-to-Audio Generation Models},
author = {Christian Simon and Masato Ishii and Wei-Yao Wang and Koichi Saito and Akio Hayakawa and Dongseok Shim and Zhi Zhong and Shuyang Cui and Shusuke Takahashi and Takashi Shibuya and Yuki Mitsufuji},
journal= {arXiv preprint arXiv:2602.20981},
year = {2026}
}
备注
Accepted to CVPR 2026