中文

RCR:从单张大场景图像中进行鲁棒人群重建与直立空间

计算机视觉与模式识别 2025-05-26 v2

摘要

本文聚焦于从单张大场景图像中实现空间一致性的数百个人体姿态和形状重建,图像中人体尺度各异且相机视场角任意。由于2D人体尺度小且变化大、深度模糊以及透视畸变,现有方法均无法实现具有正确重投影的全局一致性重建。为解决这些挑战,我们首先提出一个新概念——人机场景虚拟交互点(HVIP),将复杂的3D人体定位转换为2D像素定位。然后我们将其扩展为RCR(鲁棒人群重建),在不同相机视场角下实现全局一致性重建和稳定泛化,且无需测试时优化。为感知不同像素尺寸的人体,我们提出迭代地面感知裁剪,自动裁剪图像然后合并结果。为消除重建过程中相机和裁剪过程的影响,我们引入规范直立3D空间及相应的直立2D空间。为连接规范空间与相机空间,我们提出直立归一化,将局部裁剪输入转换到直立2D空间,并将直立3D空间的输出转换到统一的相机空间。此外,我们贡献了两个基准数据集LargeCrowd和SynCrowd,用于评估大场景中的重建效果。实验结果证明了所提方法的有效性。源代码和数据将对研究公开。

关键词

引用

@article{arxiv.2411.06232,
  title  = {RCR: Robust Crowd Reconstruction with Upright Space from a Single Large-scene Image},
  author = {Jing Huang and Hao Wen and Tianyi Zhou and Haozhe Lin and Yu-kun Lai and Kun Li},
  journal= {arXiv preprint arXiv:2411.06232},
  year   = {2025}
}