中文

Animate-X: 基于增强运动表示的通用人物图像动画

计算机视觉与模式识别 2024-12-12 v2

摘要

人物图像动画即从参考图像和目标姿态序列生成高质量视频,近年来取得了显著进展。然而,大多数现有方法仅适用于人类图式,而在游戏和娱乐等行业常用的拟人角色上难以良好推广。我们的深入分析表明,这一限制归因于其对运动建模不足,无法理解驱动视频的运动模式,从而将姿态序列严格地施加到目标人物上。为此,本文提出了Animate-X,一个基于LDM的通用动画框架,适用于各种人物类型(统称为X),包括拟人角色。为增强运动表示,我们引入了Pose Indicator,通过隐式和显式两种方式从驱动视频中捕获其运动模式。前者利用CLIP视觉特征提取驱动视频的运动意象,如整体运动模式和运动之间的时间关系,而后者通过模拟推理期间可能出现的各种输入来增强LDM的泛化性。此外,我们引入了新的Animated Anthropomorphic Benchmark (A^2Bench) 来评估Animate-X在通用和广泛适用的动画图像上的性能。大量实验表明,Animate-X 在SOTA方法之上具有优势和有效性。

关键词

引用

@article{arxiv.2410.10306,
  title  = {Animate-X: Universal Character Image Animation with Enhanced Motion Representation},
  author = {Shuai Tan and Biao Gong and Xiang Wang and Shiwei Zhang and Dandan Zheng and Ruobing Zheng and Kecheng Zheng and Jingdong Chen and Ming Yang},
  journal= {arXiv preprint arXiv:2410.10306},
  year   = {2024}
}