中文

ArtHOI: 利用基础模型实现手-可操作物体交互的单目4D重建

计算机视觉与模式识别 2026-03-30 v1

摘要

现有手-物体交互(HOI)方法大多局限于刚性物体,而可操作物体的4D重建通常需要预先扫描物体甚至多视角视频。从单目RGB视频中重建4D人手-可操作物体交互仍是一个尚未被探索但意义重大的挑战。幸运的是,基础模型的最新进展为解决这一高度不适定问题提供了新机会。为此,我们提出了ArtHOI,一个整合与精炼多个基础模型先验的基于优化的框架。我们的核心贡献是一套旨在解决这些先验固有不准确性和物理不真实性的新颖方法。具体而言,我们引入了一种自适应采样精炼(ASR)方法,用于优化物体的度量尺度与姿态,以将其归一化网格定位到世界空间中。此外,我们提出了一种多模态大语言模型(MLLM)引导的手-物体对齐方法,利用接触推理信息作为手-物体网格组合优化的约束。为了便于全面评估,我们还贡献了两个新数据集ArtHOI-RGBD和ArtHOI-Wild。大量实验验证了ArtHOI在多样化物体与交互上的鲁棒性与有效性。项目地址: https://arthoi-reconstruction.github.io.

关键词

引用

@article{arxiv.2603.25791,
  title  = {ArtHOI: Taming Foundation Models for Monocular 4D Reconstruction of Hand-Articulated-Object Interactions},
  author = {Zikai Wang and Zhilu Zhang and Yiqing Wang and Hui Li and Wangmeng Zuo},
  journal= {arXiv preprint arXiv:2603.25791},
  year   = {2026}
}

备注

Accepted to CVPR 2026