中文

AnimaX:基于联合视频-姿态扩散模型的3D中性动画

计算机视觉与模式识别 2025-06-25 v1

摘要

我们提出AnimaX,一种面向3D动画的feed-forward框架,桥接视频扩散模型的运动先验与骨架化动画的可控结构。传统运动合成方法要么受限于固定的骨骼拓扑,要么需要在高维变形空间中进行高成本优化。相比之下,AnimaX有效地将视频中的运动知识传递到3D域,支持具有任意骨骼的多样化刚性网格。我们的 method 将3D运动表示为多视角、多帧2D姿态图,并支持基于模板渲染和文本运动提示的联合视频-姿态扩散。我们引入共享位置编码和模态感知嵌入,以确保视频和姿态序列之间的时空对齐,有效地将视频先验传递到运动生成任务中。生成的多视角姿态序列经三角化后转化为3D关节点位置,再通过逆运动学转化为网格动画。我们构建了一个新建的包含160,000个rigged序列的数据集进行训练,AnimaX在VBench上的泛化性、运动保真度和效率方面均实现了最先进的成绩,为类别无关的3D动画提供了可扩展的解决方案。项目页面:https://anima-x.github.io/。

关键词

引用

@article{arxiv.2506.19851,
  title  = {AnimaX: Animating the Inanimate in 3D with Joint Video-Pose Diffusion Models},
  author = {Zehuan Huang and Haoran Feng and Yangtian Sun and Yuanchen Guo and Yanpei Cao and Lu Sheng},
  journal= {arXiv preprint arXiv:2506.19851},
  year   = {2025}
}

备注

Project page: https://anima-x.github.io/