中文

基于深度的度量感知时序一致性用于单目视频人体网格恢复

计算机视觉与模式识别 2026-02-05 v1

摘要

单目视频人体网格恢复面临保持度量一致性和时序稳定性的根本挑战,这源于深度歧义和尺度不确定性。虽然现有方法主要依赖 RGB 特征和时序平滑,但在深度排序、尺度漂移和遮挡引起的不稳定性方面仍存在困难。我们提出了一个综合性的深度引导框架,通过三个协同组件实现度量感知时序一致性:一个深度引导的多尺度融合模块,通过置信度感知的门控机制将几何先验与 RGB 特征自适应地集成;一个深度引导的度量感知姿态和形状 (D-MAPS) 估计器,利用深度校准的骨骼统计信息实现尺度一致的初始化;一个运动深度对齐精炼 (MoDAR) 模块,通过运动动态和几何线索之间的跨模态注意力机制实现时序一致性。我们的方法在三个具有挑战性的基准测试上取得优异结果,显著提高了对重度遮挡的鲁棒性和空间精度,同时保持了计算效率。

关键词

引用

@article{arxiv.2602.04257,
  title  = {Depth-Guided Metric-Aware Temporal Consistency for Monocular Video Human Mesh Recovery},
  author = {Jiaxin Cen and Xudong Mao and Guanghui Yue and Wei Zhou and Ruomei Wang and Fan Zhou and Baoquan Zhao},
  journal= {arXiv preprint arXiv:2602.04257},
  year   = {2026}
}