ForeHOI:从日常手物交互视频进行前馈式3D物体重建
计算机视觉与模式识别
2026-02-09 v1
摘要
单目视频中捕捉的日常手物交互行为无处不在,为具身智能提供了宝贵资源。尽管从野外视频中进行3D手部重建已取得显著进展,但由于严重的遮挡以及相机、手和物体之间复杂的耦合运动,重建所涉及的物体仍然具有挑战性。在本文中,我们介绍了ForeHOI,一种新颖的前馈模型,它能在1分钟的推理时间内直接从单目手物交互视频中重建3D物体几何形状,无需任何预处理步骤。我们的关键见解是,在前馈框架中联合预测2D掩码修复和3D形状补全,可以有效解决单目手持物体视频中的严重遮挡问题,从而获得优于基于优化方法的结果。2D和3D形状补全之间的信息交换提升了整体重建质量,使框架能够有效处理严重的手物遮挡。此外,为支持模型训练,我们贡献了首个大规模、高保真的手物交互合成数据集,并附有全面的标注。大量实验表明,ForeHOI在物体重建方面达到了最先进的性能,显著优于先前方法,并实现了约100倍的加速。代码和数据可在 https://github.com/Tao-11-chen/ForeHOI 获取。
引用
@article{arxiv.2602.06226,
title = {ForeHOI: Feed-forward 3D Object Reconstruction from Daily Hand-Object Interaction Videos},
author = {Yuantao Chen and Jiahao Chang and Chongjie Ye and Chaoran Zhang and Zhaojie Fang and Chenghong Li and Xiaoguang Han},
journal= {arXiv preprint arXiv:2602.06226},
year = {2026}
}
备注
14 pages, 7 figures, Page: https://tao-11-chen.github.io/project_pages/ForeHOI/