以自我为中心的手与物体交互姿态估计的基准与挑战
计算机视觉与模式识别
2026-01-23 v2
摘要
我们用双手与世界交互,并通过自己的(自我中心)视角观察世界。从自我中心视角整体理解此类交互的 3D 信息,对于机器人学、AR/VR、动作识别和运动生成等任务至关重要。由于严重的遮挡、视点偏差、相机畸变以及头部运动引起的运动模糊,在 3D 中精确重建此类交互极具挑战性。为此,我们基于 AssemblyHands 和 ARCTIC 数据集设计了 HANDS23 挑战赛,并精心设计了训练和测试划分。基于排行榜上排名靠前的方法和更新的基线结果,我们对 3D 手部(-物体)重建任务进行了深入分析。我们的分析证明了处理自我中心相机特有畸变、采用高容量 Transformer 学习复杂手-物交互以及融合不同视角预测的有效性。我们的研究进一步揭示了当前最先进方法难以处理的挑战性场景,例如快速手部运动、从狭窄自我中心视角重建物体以及双手与物体之间的紧密接触。我们的努力将丰富社区的知识基础,并促进未来关于自我中心手-物交互的手部研究。
引用
@article{arxiv.2403.16428,
title = {Benchmarks and Challenges in Pose Estimation for Egocentric Hand Interactions with Objects},
author = {Zicong Fan and Takehiko Ohkawa and Linlin Yang and Nie Lin and Zhishan Zhou and Shihao Zhou and Jiajun Liang and Zhong Gao and Xuanyang Zhang and Xue Zhang and Fei Li and Zheng Liu and Feng Lu and Karim Knaebel and Bastian Leibe and Jeongwan On and Seungryul Baek and Aditya Prakash and Saurabh Gupta and Kun He and Yoichi Sato and Otmar Hilliges and Hyung Jin Chang and Angela Yao},
journal= {arXiv preprint arXiv:2403.16428},
year = {2026}
}
备注
Accepted to ECCV 2024