MoCapAnything:从单目视频中实现任意骨架的统一3D运动捕捉
计算机视觉与模式识别
2026-05-01 v2
摘要
运动捕捉技术如今已深远影响内容创作,但大多数现有流程仍局限于特定物种或模板。我们将这一差距形式化为“类别无关运动捕捉”(CAMoCap):给定单目视频和任意绑定3D资产作为提示,目标是重建能直接驱动该特定资产的旋转基动画画(BVH)。我们提出了MoCapAnything,一个参考引导的、可分解的框架,首先预测3D关节轨迹,然后通过约束感知的逆运动学恢复资产特定的旋转。该系统包含三个可学习模块和一个轻量级IK阶段:(1)参考提示编码器,从资产的骨骼、网格和渲染图像中提取每关节查询;(2)视频特征提取器,计算稠密视觉描述符并重建粗糙的4D变形网格,以弥补视频空间与关节空间之间的差距;(3)统一运动解码器,将这些线索融合以产生时序连贯的轨迹。我们还构建了Truebones Zoo,包含1038个运动片段,每个片段提供标准化的骨骼-网格-渲染三元组。在域内基准测试和野外视频上进行的实验表明,MoCapAnything能提供高质量的骨骼动画,并在异构 rigs 之间实现有意义的跨物种 retargeting,使其能够为任意资产提供可扩展的、提示驱动的3D运动捕捉。项目页面:https://animotionlab.github.io/MoCapAnything/
引用
@article{arxiv.2512.10881,
title = {MoCapAnything: Unified 3D Motion Capture for Arbitrary Skeletons from Monocular Videos},
author = {Kehong Gong and Zhengyu Wen and Weixia He and Mingxi Xu and Qi Wang and Ning Zhang and Zhengyu Li and Dongze Lian and Wei Zhao and Xiaoyu He and Mingyuan Zhang},
journal= {arXiv preprint arXiv:2512.10881},
year = {2026}
}
备注
Accepted to CVPR 2026