面向几何感知与运动引导的视频人体网格恢复
计算机视觉与模式识别
2026-01-30 v1
摘要
现有视频基准3D人体网格恢复(HMR)方法常产生物理上不合理的结果,原因在于依赖不完美的中间3D姿态锚点以及无法有效建模复杂时空动力学。为克服这些根本性问题,本文引入HMRMamba,首次在HMR中运用结构状态空间模型(SSM),其高效性与长程建模能力为方法提供支撑。该框架由两项核心贡献构成。其一,几何感知提升模块, featuring novel dual-scan Mamba 架构,为重建奠定稳健基础。它直接以图像特征中的几何线索为2D至3D姿态提升过程提供支撑,生成高度可靠的3D姿态序列,作为稳定锚点。其二,运动引导重建网络利用该锚点显式处理时间上的运动学模式。通过注入这种关键时序意识,显著提升最终网格的一致性与鲁棒性,尤其在遮挡和运动模糊情况下效果显著。在3DPW、MPI-INF-3DHP和Human3.6M基准上的全面评估表明,HMRMamba 达到新的最佳纪录,在恢复精度和时序一致性方面均优于现有方法,同时提供卓越的计算效率。
引用
@article{arxiv.2601.21376,
title = {Towards Geometry-Aware and Motion-Guided Video Human Mesh Recovery},
author = {Hongjun Chen and Huan Zheng and Wencheng Han and Jianbing Shen},
journal= {arXiv preprint arXiv:2601.21376},
year = {2026}
}