Human3R:每个人在每个地方一次搞定
计算机视觉与模式识别
2026-03-04 v2
摘要
我们提出了 Human3R,这是一个用于从随意捕获的单摄像机视频中进行在世界坐标系中的在线4D人体-场景重建的统一、前馈框架。与依赖多阶段管道、人类与场景之间迭代接触感知 refinement 以及重依赖项(如人体检测、深度估计和SLAM预处理)的先前方法不同,Human3R 在单次前向传递中联合恢复全局多人 SMPL-X 身体("每个人")、稠密3D场景("每个地方")和相机轨迹("一次性全部搞定")。本方法基于4D在线重建模型 CUT3R,使用参数高效的视觉提示调优,以致力于保留 CUT3R 的丰富时空先验,同时实现对多个 SMPL-X 身体的直接读取。Human3R 是一个统一模型,消除了重依赖项和迭代 refinement。经过仅用一张 GPU 在一天内在相对小规模的合成数据集 BEDLAM 上训练,它实现了卓越的性能:以一次性方式重建多个人类,同时重建3D场景,一阶段即实现实时(15 FPS)运行,内存占用低(8 GB)。广泛的实验表明,Human3R 在包括全局人体运动估计、局部人体网格恢复、视频深度估计和相机姿态估计等任务方面达到或接近最先进的性能,仅用一个统一模型。我们希望 Human3R 能作为一个简单而强大的基线,便于为下游应用进行适配。代码、模型和4D交互演示均可在 https://fanegg.github.io/Human3R/ 访问。
关键词
引用
@article{arxiv.2510.06219,
title = {Human3R: Everyone Everywhere All at Once},
author = {Yue Chen and Xingyu Chen and Yuxuan Xue and Anpei Chen and Yuliang Xiu and Gerard Pons-Moll},
journal= {arXiv preprint arXiv:2510.06219},
year = {2026}
}
备注
Page: https://fanegg.github.io/Human3R Code: https://github.com/fanegg/Human3R