AnyHand:用于 RGB(-D) 手势估计的大规模合成数据集
计算机视觉与模式识别
2026-03-31 v2
摘要
我们提出 AnyHand,一个大规模合成数据集,旨在推进从纯 RGB 和 RGB-D 输入进行 3D 手势估计的现有技术水平。虽然基于基础模型方法的近期工作已表明,训练数据数量和多样性的增加可以显著提升手势估计的性能和鲁棒性,但该任务的真实世界采集数据集在覆盖范围上有限,而先前的合成数据集很少能同时大规模提供遮挡、手臂细节和对齐深度。为了解决这一瓶颈,我们的 AnyHand 包含 250 万张单手势和 410 万张手势-物体交互 RGB-D 图像,具有丰富的几何标注。在纯 RGB 设置中,我们表明将 AnyHand 扩展到现有基线的原始训练集可以在多个基准(FreiHAND 和 HO-3D)上带来显著提升,即使保持架构和训练方案不变。更令人印象深刻的是,用 AnyHand 训练的模型在无需微调的情况下展现出对域外 HO-Cap 数据集更强的泛化能力。我们还贡献了一个轻量级深度融合模块,可以轻松集成到现有的基于 RGB 的模型中。用 AnyHand 训练的 RGB-D 模型在 HO-3D 基准上取得了优越性能,展示了深度集成的好处和我们合成数据的有效性。
引用
@article{arxiv.2603.25726,
title = {AnyHand: A Large-Scale Synthetic Dataset for RGB(-D) Hand Pose Estimation},
author = {Chen Si and Yulin Liu and Bo Ai and Jianwen Xie and Rolandos Alexandros Potamias and Chuanxia Zheng and Hao Su},
journal= {arXiv preprint arXiv:2603.25726},
year = {2026}
}