Hamba:基于图引导的单视图 3D 手部重建中的 Mamba 框架
计算机视觉与模式识别
2025-11-27 v2 机器人学
摘要
从单张 RGB 图像重建 3D 手部姿态具有自由度运动、自遮挡以及与物体相互作用等挑战。现有 SOTA 方法采用基于注意力的变换器来学习 3D 手部姿态和形状,但主要由于高效建模手关节之间的空间关系而未能实现稳健和准确的性能。为此,我们提出一种新型图引导 Mamba 框架,称为 Hamba,将图学习与状态空间建模相结合。我们的核心思想是将 Mamba 的扫描方式重新表述为图引导的双向扫描,用于通过少量有效标记实现 3D 重建。这使我们能够高效地学习手关节之间的空间关系,从而提高重建性能。具体而言,我们设计了一个图引导状态空间 (GSS) 块,用于学习手关节的图结构关系和空间序列,并使用 88.5% 更少的标记。此外,我们集成了状态空间特征和全局特征的融合模块。通过运用 GSS 块和融合模块,Hamba 有效地利用图引导状态空间特征,联合考虑全局和局部特征以提升性能。在多个基准测试和野外测试中实验表明,Hamba 显著优于现有 SOTA 方法,在 FreiHAND 数据集上实现 PA-MPVPE 为 5.3mm,F@15mm 为 0.992。本文录用时,Hamba 在两个 3D 手部重建竞赛排行榜中位居第一。项目网站:https://humansensinglab.github.io/Hamba/。
引用
@article{arxiv.2407.09646,
title = {Hamba: Single-view 3D Hand Reconstruction with Graph-guided Bi-Scanning Mamba},
author = {Haoye Dong and Aviral Chharia and Wenbo Gou and Francisco Vicente Carrasco and Fernando De la Torre},
journal= {arXiv preprint arXiv:2407.09646},
year = {2025}
}
备注
NeurIPS 2024; Project Website: https://humansensinglab.github.io/Hamba/