中文

单视图模型是多视图人体网格恢复的强学习者

计算机视觉与模式识别 2026-04-02 v2

摘要

多视图人体网格恢复(HMR)广泛应用于需要高精度和强泛化能力的领域。现有方法可大致分为基于几何和基于学习的两类。然而,基于几何的方法(如三角化)依赖复杂的相机标定,而学习方法由于缺乏多视图训练数据,往往难以泛化到未见的相机配置,限制了其在实际场景中的性能。为实现无标定的重建并适用于任意相机设置,我们提出一种无需多视图训练数据的训练自由框架,利用预训练的单视图HMR模型作为强先验。我们的方法首先从单视图预测构建稳健且一致的多视图初始化,然后通过多视图一致性和解剖约束指导的测试时优化进行细化。广泛的实验表明,我们的方法在标准基准数据集上实现了领先性能,超越了使用显式多视图监督训练的多视图模型。

关键词

引用

@article{arxiv.2603.20391,
  title  = {Monocular Models are Strong Learners for Multi-View Human Mesh Recovery},
  author = {Haoyu Xie and Shengkai Xu and Cheng Guo and Muhammad Usama Saleem and Wenhan Wu and Chen Chen and Ahmed Helmy and Pu Wang and Hongfei Xue},
  journal= {arXiv preprint arXiv:2603.20391},
  year   = {2026}
}