面向未见领域的 egocentric 3D 手姿态估计
计算机视觉与模式识别
2026-01-13 v1
摘要
我们提出了 V-HPOT,一种用于提高 3D 手姿态估计在跨域场景下表现的新方法。当前 SOTA 方法在训练与测试处于同一领域时表现优异,但由于训练数据有限和深度感知不足,难以泛化到新环境——容易过拟合到特定相机内参。我们的 метод 通过估计虚拟相机空间中的关键点 z 坐标,并以焦距和图像大小归一化,从而实现对相机无关的深度预测。我们进一步利用这种相机内参不变性,提出一种自监督的测试时优化策略,在推理期间优化模型的深度感知。这通过在预测的手姿态与仿射变换后的手姿态之间应用 3D 一致性损失实现,使模型能够在无需 ground truth 标注的情况下适应目标领域特征。V-HPOT 在跨域场景下显著提升了 3D 手姿态估计性能,在 H2O 数据集上将平均姿态误差降低 71%,在 AssemblyHands 数据集上降低 41%。与当前 SOTA 方法相比,V-HPOT 在所有数据集上均优于所有单阶段方法,且仅需约 x3.5 到 x14 的数据量,便可与两种两阶段方法肩并肝地竞争。
引用
@article{arxiv.2601.06537,
title = {Towards Egocentric 3D Hand Pose Estimation in Unseen Domains},
author = {Wiktor Mucha and Michael Wray and Martin Kampel},
journal= {arXiv preprint arXiv:2601.06537},
year = {2026}
}
备注
Accepted at WACV 2026