MTVCraft:用于任意角色动画的4D运动分词化
计算机视觉与模式识别
2026-03-10 v5
摘要
角色图像动画技术近年来迅速发展,得益于数字人类的出现。然而,现有方法主要依赖2D渲染姿态图像作为运动导向,限制了泛化能力并丢弃了开放世界动画中至关重要的4D信息。为此,我们提出了MTVCraft(Motion Tokenization Video Crafter),即是第一个直接建模原始3D运动序列(即4D运动)用于角色图像动画的框架。具体而言,我们引入4DMoT(4D motion tokenizer)将3D运动序列量化为4D运动标记。与2D渲染姿态图像相比,4D运动标记提供了更稳健的时空线索,避免了姿态图像与角色之间严格的像素级对齐,实现更灵活且解耦的控制。随后,我们引入MV-DiT(Motion-aware Video DiT)。通过设计独特的运动注意力机制和4D位置编码,MV-DiT能够有效地将运动标记作为4D紧凑且富有表现力的上下文,用于角色图像动画。我们在CogVideoX-5B(小规模)和Wan-2.1-14B(大规模)上实现了MTVCraft,证明该框架易于扩展,可应用于规模不同的模型。在TikTok和Fashion基准测试中实现了最先进的性能。此外,凭借稳健的运动标记,MTVCraft展现了卓越的零样本泛化能力。它可以为任意角色在全身和半身形式中进行动画处理,甚至可以对非人类对象在多样化的风格和场景中进行动画处理。因此,它标志着该领域的重要进展,为姿态引导视频生成开辟了新的方向。我们的项目页面位于https://github.com/DINGYANB/MTVCrafter。已缩放版本已商业部署,可在https://telestudio.teleagi.cn/generatevideo/creativeWorkshop访问。
引用
@article{arxiv.2505.10238,
title = {MTVCraft: Tokenizing 4D Motion for Arbitrary Character Animation},
author = {Yanbo Ding and Xirui Hu and Zhizhi Guo and Yan Zhang and Xinrui Wang and Zhixiang He and Chi Zhang and Yali Wang and Xuelong Li},
journal= {arXiv preprint arXiv:2505.10238},
year = {2026}
}