RHINO:从单目视频重建带有新颖物体的人类互动
计算机视觉与模式识别
2026-05-19 v1
摘要
从单目视频中重建人物、物体及其 3D 互动是智能系统长久以来的目标。输入往往是来自移动摄像机的 RGB 视频,使得该任务不够明确;深度模糊不清,人类与物体相互遮挡,摄像机与物体运动交织产生幻象运动。大多数先前工作要么只关注人或物体的单独情况,要么假设已知的 3D 形状或摄像机,这在实际应用中不够实用。我们开发了 RHINO (Reconstructing Human Interactions with Novel Objects),一个三步框架,能够从单目 RGB 视频中恢复出人物、未知(未见过的)操作物体以及静态场景,并统一映射到共同的世界坐标系。第一步,我们利用 3D 认知基础模型获取线索,即使在低纹理区域也能稳定 Structure-from-Motion (SfM),从而得到操作物体的粗糙形状和幻象运动,以及场景的粗糙形状和摄像机运动。第二步,我们通过现成方法估计摄像机框架下的人物,并从幻象运动中减去摄像机运动,以提取物体运动;这将人物、物体和粗糙场景形状注册到共同的世界坐标系。第三步,我们使用具有每个组件符号距离场的组合神经场来细化形状。后者进一步启用了可微分接触先验,将表面吸引力和惩罚间穿透,从而提高最终重建的物理合理性。为进行评估,我们收集了一个新的数据集,其中中的单摄像机手持视频与体积 4D 捕获阶段同步,提供真实的形状和摄像机运动。RHINO 在新视角合成和 4D 重建方面均优于最先进的基线方法。消融实验表明,每个阶段都有显著贡献。代码和数据均可在 https://lxxue.github.io/RHINO 获取。
引用
@article{arxiv.2605.17014,
title = {RHINO: Reconstructing Human Interactions with Novel Objects from Monocular Videos},
author = {Lixin Xue and Chengwei Zheng and Georgios Paschalidis and Chen Guo and Manuel Kaufmann and Juan Zarate and Dimitrios Tzionas},
journal= {arXiv preprint arXiv:2605.17014},
year = {2026}
}
备注
CVPR 2026. Project page: https://lxxue.github.io/RHINO