日常第一人称图像中的3D手部姿态估计
计算机视觉与模式识别
2024-09-24 v2 人工智能
机器学习
机器人学
摘要
日常第一人称图像中的3D手部姿态估计因多种原因具有挑战性:视觉信号差(交互物体的遮挡、低分辨率和运动模糊)、透视畸变大(手靠近相机),以及受控设置之外缺乏3D标注。现有方法通常使用手部裁剪作为输入以关注细粒度视觉信息来处理视觉信号差的问题,但由透视畸变和真实场景中缺乏3D标注带来的挑战尚未得到系统研究。我们聚焦于这一空白,并探索不同实践的影响,即裁剪作为输入、融入相机信息、辅助监督、扩大数据集规模。我们提供了若干适用于卷积模型和Transformer模型的见解,从而带来更好的性能。基于我们的发现,我们还提出了WildHands,一个用于日常第一人称图像中3D手部姿态估计的系统。在4个多样化数据集(H2O、AssemblyHands、Epic-Kitchens、Ego-Exo4D)上的零样本评估证明了我们的方法在2D和3D指标上的有效性,我们以7.4%至66%的优势超越了以往方法。在系统级比较中,WildHands在ARCTIC第一人称分割上取得了最佳的3D手部姿态,在所有指标上优于FrankMocap,在6项指标中的3项上优于HaMeR,同时模型尺寸小10倍,训练数据少5倍。
引用
@article{arxiv.2312.06583,
title = {3D Hand Pose Estimation in Everyday Egocentric Images},
author = {Aditya Prakash and Ruisen Tu and Matthew Chang and Saurabh Gupta},
journal= {arXiv preprint arXiv:2312.06583},
year = {2024}
}
备注
ECCV 2024, Project page: https://ap229997.github.io/projects/hands/