中文

基于 Diffusion Transformer 的高保真长时长人体图像动画

计算机视觉与模式识别 2025-12-29 v1

摘要

扩散模型的最新进展显著推动了人体图像动画领域的发展。尽管现有方法能够针对短时或常规运动生成时间一致的结果,但在生成长时长视频方面仍存在重大挑战。此外,细粒度面部和手部细节的合成仍待深入探索,限制了当前方法在真实世界高质量应用中的适用性。为了解决这些局限性,我们提出了一个基于扩散变换器的框架,专注于生成高保真且长时长的人体动画视频。首先,我们设计了一组混合隐式引导信号和一个锐度引导因子,使我们的框架能够额外引入详细的面部和手部特征作为引导。其次,我们引入了时间感知位置平移融合模块,修改了 DiT 主干内的输入格式,并将此机制称为位置平移自适应模块,从而实现任意长度视频的生成。最后,我们引入了一种新颖的数据增强策略和骨架对齐模型,以减少不同身份间人体形状变化的影响。实验结果表明,我们的方法优于现有的最先进方法,在高保真和长时长人体图像动画中均取得了卓越的性能。

关键词

引用

@article{arxiv.2512.21905,
  title  = {High-Fidelity and Long-Duration Human Image Animation with Diffusion Transformer},
  author = {Shen Zheng and Jiaran Cai and Yuansheng Guan and Shenneng Huang and Xingpei Ma and Junjie Cao and Hanfeng Zhao and Qiang Zhang and Shunsi Zhang and Xiao-Ping Zhang},
  journal= {arXiv preprint arXiv:2512.21905},
  year   = {2025}
}