EgoHandICL:基于上下文学习的自我中心 3D 手部重建
计算机视觉与模式识别
2026-01-28 v1
摘要
由于深度模糊、自遮挡以及复杂的手物交互,在自我中心视觉下实现鲁棒的 3D 手部重建具有挑战性。先前的方法通过扩大训练数据规模或添加辅助线索来缓解这些问题,但在未见过的场景中往往难以奏效。我们提出了 EgoHandICL,这是首个用于 3D 手部重建的上下文学习(ICL)框架,旨在改善具有挑战性的自我中心条件下的语义对齐、视觉一致性和鲁棒性。EgoHandICL 引入了由视觉语言模型(VLM)引导的互补示例检索、为 ICL 量身定制的多模态上下文分词器,以及基于掩码自编码器(MAE)并使用手部引导几何与感知目标进行训练的架构。在 ARCTIC 和 EgoExo4D 上的实验表明,该方法相较于 SOTA 方法取得了持续的提升。我们还展示了其在真实世界中的泛化能力,并通过将重建的手部作为视觉提示,改进了 EgoVLM 的手物交互推理。代码和数据:https://github.com/Nicous20/EgoHandICL
引用
@article{arxiv.2601.19850,
title = {EgoHandICL: Egocentric 3D Hand Reconstruction with In-Context Learning},
author = {Binzhu Xie and Shi Qiu and Sicheng Zhang and Yinqiao Wang and Hao Xu and Muzammal Naseer and Chi-Wing Fu and Pheng-Ann Heng},
journal= {arXiv preprint arXiv:2601.19850},
year = {2026}
}
备注
Accepted in ICLR 2026, Codebase: https://github.com/Nicous20/EgoHandICL