EasyHOI:释放大型模型在野外重建手部-物体交互的力量
计算机视觉与模式识别
2025-12-22 v4
摘要
本工作旨在从单视图图像中重建手部-物体交互, 这是一个基础但高度依赖假设的任务。不同于基于视频、多视图图像或预定义 3D 模板的方法,单视图重建面临显著的内在歧义和遮挡挑战。这些挑战因手部姿态的多样性以及物体形状和尺寸的广泛差异而进一步加剧。我们的关键洞察是, 当前用于分割、图像填充和 3D 重建的基础模型能够稳健地泛化到野外图像, 这为重建手部-物体交互提供了强大的视觉和几何先验。具体而言, 给定单张图像, 我们首先设计了一条新型管道, 用于通过即插即用的大型模型估计手部姿态和物体形状。随后, 在初始重建基础上, 我们采用先验引导的优化方案, 将手部姿态优化以符合 3D 物理约束和 2D 输入图像内容。我们在多个数据集上进行实验, 结果表明该方法在各项基线方法上均显著优于后者, 能忠实地重建多样化的手部-物体交互。项目页面链接: https://lym29.github.io/EasyHOI-page/。
引用
@article{arxiv.2411.14280,
title = {EasyHOI: Unleashing the Power of Large Models for Reconstructing Hand-Object Interactions in the Wild},
author = {Yumeng Liu and Xiaoxiao Long and Zemin Yang and Yuan Liu and Marc Habermann and Christian Theobalt and Yuexin Ma and Wenping Wang},
journal= {arXiv preprint arXiv:2411.14280},
year = {2025}
}
备注
Project page: https://lym29.github.io/EasyHOI-page/