中文

MoReFun:基于过去运动的运动表示学习用于未来运动预测与理解

计算机视觉与模式识别 2025-11-19 v2

摘要

3D 人体运动预测旨在从观察序列中生成连贯的未来运动,但现有的端到端回归框架往往无法捕捉复杂的动力学,倾向于产生在时间上不一致或静态的预测——这一局限性源于表示简化,其中模型依赖浅层线索而非学习有意义的运动结构。我们提出了一个两阶段自监督框架,使表示学习与预测解耦。在预训练阶段,模型执行统一的过去-未来自重建,在完全的历史指导下重建过去序列的同时恢复被遮盖的未来关节。在基于速度的遮蔽策略中挑选高度动态的关节,迫使模型聚焦于信息丰富的运动组件,并在无回归干扰的情况下内化过去与未来状态之间的统计依赖性。在微调阶段,预训练模型预测整个被完全遮蔽的未来序列,并进一步配备轻量级的未来文本预测头,以实现低层运动预测与高层运动理解的联合优化。在 Human3.6M、3DPW 和 AMASS 上的实验表明,我们的方法相对于最先进的方法将平均预测误差降低 8.8%,同时在与 LLM-based 模型相当的水平上实现了竞争的未来运动理解性能。代码地址:https://github.com/JunyuShi02/MoReFun

关键词

引用

@article{arxiv.2408.02091,
  title  = {MoReFun: Past-Movement Guided Motion Representation Learning for Future Motion Prediction and Understanding},
  author = {Junyu Shi and Haoting Wu and Zhiyuan Zhang and Lijiang Liu and Yong Sun and Qiang Nie},
  journal= {arXiv preprint arXiv:2408.02091},
  year   = {2025}
}