中文

音乐驱动的图像动画:每张图像都能聆听,每张图像都能舞动

计算机视觉与模式识别 2025-02-03 v1 人工智能

摘要

图像动画已成为多模态研究中的热门领域,主要聚焦于从参考图像生成视频。虽然先前工作大多强调以文本为导向的通用视频生成,但音乐驱动的舞蹈视频生成仍鲜有探索。本文引入MuseDance,一种创新的端到端模型,可同时利用音乐和文本输入来动画化参考图像。这种双输入使MuseDance能够生成遵循文本描述并与音乐同步人物动作的个性化视频。不同于现有方法,MuseDance无需复杂的运动指导输入(如姿态或深度序列),使所有水平用户均能轻松进行灵活创意的视频生成。为推动该领域的研究,本文提供了一个新的多模态数据集,包含2,904个舞蹈视频,配有相应背景音乐和文本描述。我们的做法利用基于扩散的方法实现稳健的泛化、精确的控制和时间一致性,为音乐驱动图像动画任务设定了新基准。

关键词

引用

@article{arxiv.2501.18801,
  title  = {Every Image Listens, Every Image Dances: Music-Driven Image Animation},
  author = {Zhikang Dong and Weituo Hao and Ju-Chiang Wang and Peng Zhang and Pawel Polak},
  journal= {arXiv preprint arXiv:2501.18801},
  year   = {2025}
}