中文

从多人多视角视频中单次重建连贯的人-场景

计算机视觉与模式识别 2026-03-19 v2

摘要

近期3D基础模型的进展引发对重建人类及其周围环境的兴趣。然而,大多数现有方法专注于单目输入,将其扩展到多视角设置需额外模块或预处理数据。为此,我们提出CHROMM——一个统一框架,从多人多视角视频中联合估计相机、场景点云和人类网格,无需依赖外部模块或预处理。我们将Pi3X和Multi-HMR中的强几何与人类先验整合到单个可训练神经网络架构中,引入尺度调整模块以解决人类与场景之间的尺度不一致问题。我们还引入多视角融合策略以聚合每个视角的估计至测试时的单一表示。最后,我们提出几何驱动的多人关联方法,其优于基于外观的方法。在EMDB、RICH、EgoHumans和EgoExo4D上的实验表明,CHROMM在全局人体运动和多视角姿态估计方面实现了与竞争方法相当的性能,速度较先前基于优化的多视角方法快8倍以上。项目页面:https://nstar1125.github.io/chromm。

关键词

引用

@article{arxiv.2603.12789,
  title  = {Coherent Human-Scene Reconstruction from Multi-Person Multi-View Video in a Single Pass},
  author = {Sangmin Kim and Minhyuk Hwang and Geonho Cha and Dongyoon Wee and Jaesik Park},
  journal= {arXiv preprint arXiv:2603.12789},
  year   = {2026}
}

备注

Project page: https://nstar1125.github.io/chromm