中文

AnyAct:从视频中进行人类角色运动重作的通用方法

计算机视觉与模式识别 2026-05-20 v2 图形学

摘要

我们研究了从非人类角色的单目视频中直接推导出初始人类重作的问题。我们的目标不是重建源角色本身,而是将其运动重新解释为可行且可编辑的人类表演,以供下游动画 authoring 使用。这个任务具有挑战性,因为现有的视频基于运动捕捉方法主要局限于人类中心的结构空间,而运动 retargeting 方法通常需要结构化的 3D 源运动和已知的源拓扑。我们的关键洞察是,稀疏的局部具关节运动线索可以在大尺寸差异之间保留基本动力学,为从角色视频到人类重作提供稳定的桥梁。基于这一观察,我们提出 AnyAct,将角色视频驱动的人类重作形式化为从可迁移稀疏局部 2D 具关节运动的条件人类运动生成。为实用化,我们引入三个关键设计:通过增强的 3D-to-2D 投影实现仅人类运动监督、渐进式 3D-to-2D 训练以缓解条件歧义、以及全局-局部运动解耦以实现可靠的局部运动控制。我们进一步构建了一个主要覆盖多样非人类角色视频的基准。实验表明,AnyAct 产生的高保真初始人类重作保留了参考视频中角色的基本动力学,进一步的消融研究验证了其核心设计的有效性。

关键词

引用

@article{arxiv.2605.15497,
  title  = {AnyAct: Towards Human Reenactment of Character Motion From Video},
  author = {Liuhan Chen and Lei Zhong and Jiewei Wang and Qin Shuai and Li Yuan and Leidong Fan and Qing Li and Kanglin Liu},
  journal= {arXiv preprint arXiv:2605.15497},
  year   = {2026}
}

备注

12 pages