中文

音频同步视觉动画

计算机视觉与模式识别 2024-07-19 v2

摘要

当前的视觉生成方法可以生成由文本引导的高质量视频,但有效控制物体动态仍然是一个挑战。本研究探索将音频作为线索,以生成时间同步的图像动画。我们引入了音频同步视觉动画(Audio Synchronized Visual Animation, ASVA)任务,旨在利用跨多个类别的音频片段进行时间引导,使静态图像产生运动动态。为此,我们提出了 AVSync15 数据集,该数据集源自 VGGSound,包含涵盖 15 个类别的具有同步音视频事件的视频。我们还提出了一种扩散模型 AVSyncD,能够生成由音频引导的动态动画。广泛的评估验证了 AVSync15 作为同步生成基准的可靠性,并展示了我们模型的优越性能。我们进一步探索了 AVSyncD 在各种音频同步生成任务中的潜力,从无需基础图像生成完整视频,到利用各种声音控制物体运动。我们希望所建立的基准能为可控视觉生成开辟新途径。更多视频请访问项目网页 https://lzhangbj.github.io/projects/asva/asva.html。

关键词

引用

@article{arxiv.2403.05659,
  title  = {Audio-Synchronized Visual Animation},
  author = {Lin Zhang and Shentong Mo and Yijing Zhang and Pedro Morgado},
  journal= {arXiv preprint arXiv:2403.05659},
  year   = {2024}
}

备注

ECCV 2024