音视频同步视觉动画的高效扩张:一种高效训练范式
计算机视觉与模式识别
2025-08-07 v1
摘要
近期的音频同步视觉动画进展使我们能够控制来自特定类的音频。然而,现有方法依赖大量昂贵的人工策划的高质量、类别特定的训练视频,这在开放世界中扩展到多样化音频-视频类别方面存在挑战。本文提出了一种高效的两阶段训练范式,通过大量但噪声较大的视频来扩张音频同步视觉动画。在阶段一,我们自动筛选大规模视频进行预训练,使模型学习到多样化但不完美的音频-视频对齐。在阶段二,我们在规模较小的高质量示例上进行微调,显著减少了所需的人力。我们进一步通过多特征条件和窗口注意力,允许每个帧访问丰富的音频上下文以增强同步。为高效训练,我们利用预训练的文本到视频生成器和音频编码器,只引入1.9%的额外可训练参数以学习音频条件能力而不损害生成器的先验知识。为评估,我们引入AVSync48基准,包含48个类别的视频,比以前的基准多出3倍的多样性。大量实验表明,我们的方法通过超过10倍地减少对人工策划的依赖,同时能够泛化到许多开放类别。
引用
@article{arxiv.2508.03955,
title = {Scaling Up Audio-Synchronized Visual Animation: An Efficient Training Paradigm},
author = {Lin Zhang and Zefan Cai and Yufan Zhou and Shentong Mo and Jinhong Lin and Cheng-En Wu and Yibing Wei and Yijing Zhang and Ruiyi Zhang and Wen Xiao and Tong Sun and Junjie Hu and Pedro Morgado},
journal= {arXiv preprint arXiv:2508.03955},
year = {2025}
}