中文

UniSH:在单次前向传播中统一场景与人物重建

计算机视觉与模式识别 2026-01-06 v1

摘要

我们提出 UniSH,一个用于联合度量比例三维场景和人物重建的统一、前馈框架。该领域的关键挑战之一是缺乏大规模标注的真实世界数据,迫使人们依赖合成数据集。这种依赖引入了显著的仿真到现实领域鸿沟,导致泛化能力差、人物几何低保真以及在野生视频中的对齐问题。为此,我们提出一种创新的训练范式,有效利用未标记的野生数据。我们的框架桥接了来自场景重建和 HMR 的强大且差异巨大的先验,并通过两个核心组件进行训练:(1)一种稳健的蒸馏策略,通过蒸馏专家深度模型中的高频细节来细化人物表面细节;(2)两种分级监督方案,首先在合成数据上学习粗糙定位,然后通过直接优化 SMPL 网格与人物点云之间的几何对应关系进行微调。该方法使我们的前馈模型能够在单次前向传播中联合恢复高保真场景几何、人物点云、相机参数以及一致的、度量比例的 SMPL 人体。广泛的实验表明,我们的模型在人物导向场景重建方面实现了最新进展,并在全球人物运动估计方面表现出高度具竞争力,优于基于优化的框架和 HMR-only 方法。项目页面:https://murphylmf.github.io/UniSH/

关键词

引用

@article{arxiv.2601.01222,
  title  = {UniSH: Unifying Scene and Human Reconstruction in a Feed-Forward Pass},
  author = {Mengfei Li and Peng Li and Zheng Zhang and Jiahao Lu and Chengfeng Zhao and Wei Xue and Qifeng Liu and Sida Peng and Wenxiao Zhang and Wenhan Luo and Yuan Liu and Yike Guo},
  journal= {arXiv preprint arXiv:2601.01222},
  year   = {2026}
}