中文

HAMSt3R:面向人类的多视角立体 3D 重建

计算机视觉与模式识别 2025-08-25 v1

摘要

从稀疏未标定图像中恢复场景的 3D 几何一直是计算机视觉中的经典难题。虽然最近的基于学习的方法如 DUSt3R 和 MASt3R 通过直接预测稠密场景几何展示了令人瞩目的成果,但它们主要在户外静态场景上进行训练,难以处理以人为中心的情景。在本工作中,我们引入 HAMSt3R,这是 MASt3R 的一个扩展,用于从稀疏、未标定的多视角图像中进行人物与场景的联合 3D 重建。首先,我们利用 DUNE——一个通过蒸馏获得的强大图像编码器,其中包括来自 MASt3R 和来自最新人类网格恢复(HMR)模型之一的 multi-HMR 编码器,以更好地理解场景几何和人体姿态。随后,我们将额外的网络头整合进系统,以分割人物、通过 DensePose 估计稠密对应关系,并预测以人为中心的环境中的深度,从而实现更全面的 3D 重建。通过利用我们不同头部的输出,HAMSt3R 产生一个稠密点图,包含人类语义信息。不同于依赖复杂优化管道的现有方法,HAMSt3R 完全采用前馈方式,高效且适用于实际应用。我们在 EgoHumans 和 EgoExo4D 两个包含多样人为中心情景的具有挑战性的基准上评估了我们的模型。此外,我们验证了其对传统多视角立体和多视角姿态回归任务的泛化能力。我们的结果表明,该方法能够有效重建人物,同时保持在一般 3D 重建任务中的强大性能,弥合了在 3D 视觉中人物与场景理解之间的差距。

关键词

引用

@article{arxiv.2508.16433,
  title  = {HAMSt3R: Human-Aware Multi-view Stereo 3D Reconstruction},
  author = {Sara Rojas and Matthieu Armando and Bernard Ghamen and Philippe Weinzaepfel and Vincent Leroy and Gregory Rogez},
  journal= {arXiv preprint arXiv:2508.16433},
  year   = {2025}
}