面向视角自适应的人类视频生成的 3D 隐式运动控制
计算机视觉与模式识别
2026-02-17 v2
摘要
现有的人类运动控制方法通常依赖 2D 关键点或显式 3D 参数模型(如 SMPL)作为控制信号。然而,2D 关键点将运动严格绑定到驾驶视角,限制了新视角合成;显式 3D 模型虽提供结构信息,但因深度模糊和动态不准等内在缺陷,若作为强约束,会覆盖大规模视频生成器固有的强 3D 认知。本文从 3D 视角重新审视运动控制,主张一种隐式、视角无关的运动表示,自然地与生成器的空间先验对齐,而非依赖外部重建的约束。我们引入 3DiMo,通过联合训练运动编码器与预训练视频生成器,将驾驶帧蒸馏为紧凑、视角无关的运动标记,通过交叉注意力语义注入。为培育 3D 认知,我们采用视角丰富的监督(即单视角、多视角和移动相机视频),迫使运动在不同视角下保持一致。此外,我们使用辅助几何监督仅在早期初始化中利用 SMPL,并逐渐淡化至零,使模型能够从数据和生成器的先验中学习真正的 3D 空间运动理解。实验表明,3DiMo 能忠实复现驾驶运动,实现灵活的文本驱动相机控制,在运动保真度和视觉质量方面显著优于现有方法。
引用
@article{arxiv.2602.03796,
title = {3D-Aware Implicit Motion Control for View-Adaptive Human Video Generation},
author = {Zhixue Fang and Xu He and Songlin Tang and Haoxian Zhang and Qingfeng Li and Xiaoqiang Liu and Pengfei Wan and Kun Gai},
journal= {arXiv preprint arXiv:2602.03796},
year = {2026}
}
备注
Project Page: https://hjrphoebus.github.io/3DiMo/