中文

UniCon3R:基于单目视频的统一接触感知 4D 人-场景重建

计算机视觉与模式识别 2026-05-12 v2

摘要

我们引入了 UniCon3R,这是一个用于从单目视频进行在线人-场景 4D 重建的统一前馈框架。当前的前馈人-场景重建方法存在伪影问题,例如身体悬浮于地面之上或穿透场景的某些部分。一个关键原因在于缺乏人与环境之间有效的交互建模。我们的目标是在推断过程中利用人与场景之间的接触来主动改善人体网格重建。为此,我们通过从人体姿态和场景几何推断 4D 接触来显式建模交互,并将接触作为生成姿态的校正线索。这使得 UniCon3R 能够在场景内联合恢复场景几何和空间对齐的 4D 人体。在以人为中心的视频标准基准上的实验表明,UniCon3R 在物理合理性和全局人体运动估计方面优于最先进的基线方法,同时保持了快速的前馈推断速度。结果验证了我们的核心主张:接触作为一种强大的内部先验,从而为物理上合理的联合人-场景重建确立了新范式。项目页面可在 https://surtantheta.github.io/UniCon3R 获取。

关键词

引用

@article{arxiv.2604.19923,
  title  = {UniCon3R: Unified Contact-aware 4D Human-Scene Reconstruction from Monocular Video},
  author = {Tanuj Sur and Shashank Tripathi and Nikos Athanasiou and Ha Linh Nguyen and Kai Xu and Michael J. Black and Angela Yao},
  journal= {arXiv preprint arXiv:2604.19923},
  year   = {2026}
}

备注

Project page: https://surtantheta.github.io/UniCon3R