中文

CARI4D:类别无关的人-物体交互4D重建

计算机视觉与模式识别 2026-04-21 v3

摘要

准确捕捉来自RGB摄像机等常用传感器的人-物体交互对于人类理解、游戏和机器人学习等应用至关重要。然而,由于未知的物体和人体信息、深度歧义、遮挡以及复杂运动,单一RGB视图推断4D交互极具挑战性,这些因素阻碍了一致的3D和时序重建。以往方法通过假设真实物体模板或限制在有限物体类别集合上来简化设置。我们提出CARI4D,是首个实现从单目RGB视频中进行空间和时序一致的人-物体4D交互重建的方法。为此,我们提出了假设选择算法,稳健地整合基础模型的个体预测,通过学习的渲染-比较范式进行联合细化,以确保空间、时序和像素对齐,最终推理复杂接触以满足物理约束。实验表明,本方法在分布内数据集上以38%的重建误差优于先前方法,在未见数据集上以36%的优势。我们的模型超越训练类别,能够零样本应用于野生网络视频。我们将公开代码和预训练模型。

关键词

引用

@article{arxiv.2512.11988,
  title  = {CARI4D: Category Agnostic 4D Reconstruction of Human-Object Interaction},
  author = {Xianghui Xie and Bowen Wen and Yan Chang and Hesam Rabeti and Jiefeng Li and Ye Yuan and Gerard Pons-Moll and Stan Birchfield},
  journal= {arXiv preprint arXiv:2512.11988},
  year   = {2026}
}

备注

CVPR2026 camera ready version. Project page: https://nvlabs.github.io/CARI4D/