DF-Mamba:用于交互场景下 3D 手姿估计的可变形状态空间建模
计算机视觉与模式识别
2025-12-03 v1 人工智能
机器学习
摘要
建模日常手部交互时,常常面临严重遮挡问题,例如两只手重叠,这凸显了 3D 手姿估计(HPE)中需要鲁棒特征学习。为了处理遮挡手部图像,关键在于有效地学习局部图像特征(例如对于被遮挡的关节)与全局上下文(例如来自关节间关系、手间关系或场景的线索)之间的关系。然而,目前大多数 3D HPE 方法仍依赖 ResNet 进行特征提取,由于其有限的建模全局上下文能力,这种 CNN 的归纳偏差可能并非针对 3D HPE 最优。为此,我们提出一种基于最新状态空间建模(即 Mamba)的有效且高效的 3D HPE 视觉特征提取框架,称为可变形 Mamba(DF-Mamba)。DF-Mamba 通过 Mamba 的选择性状态建模和提出的可变形状态扫描,捕获超出标准卷积的全局上下文线索。具体而言,对于卷积后的局部特征,我们的可变形扫描在图像内部聚合这些特征,同时选择性地保留代表全局上下文的有用线索。该方法显著提高了结构化 3D HPE 的准确度,同时保持与 ResNet-50 相当的推理速度。我们的实验涉及五个不同数据集的广泛评估,包括单手场景和双手场景、手部独立和手部-物体交互以及 RGB 和深度-based 估计。DF-Mamba 在所有数据集上均优于最新的图像 backbone,包括 VMamba 和 Spatial-Mamba,实现了最先进的性能。
引用
@article{arxiv.2512.02727,
title = {DF-Mamba: Deformable State Space Modeling for 3D Hand Pose Estimation in Interactions},
author = {Yifan Zhou and Takehiko Ohkawa and Guwenxiao Zhou and Kanoko Goto and Takumi Hirose and Yusuke Sekikawa and Nakamasa Inoue},
journal= {arXiv preprint arXiv:2512.02727},
year = {2025}
}
备注
Accepted to WACV 2026. Project page: https://tkhkaeio.github.io/projects/25-dfmamba/index.html