AVI-HT:面向 3D 手部跟踪的自适应视觉-IMU 融合
计算机视觉与模式识别
2026-05-22 v1 机器人学
摘要
我们提出 AVI-HT,一种用于跟踪 3D 手部姿态的自适应视觉-IMU 融合方法,联合建模佩戴手套上的 6 自由度 IMU 信号与环视图像。AVI-HT 在手-物体交互 (HOI) 场景下,尤其是在重度视觉遮挡的情况下,实现了显著提升的精度和可用性。其成功背后有两个互补的关键因素:(1) 在佩戴部位同步获取的多模态训练数据,将视觉-IMU 传感器流与来自 motion-capture 系统的 3D 手部姿态进行配对;(2) 一种跨传感器深度注意力机制,自适应调节对视觉和各个 IMU 传感器的可信度分配。为评估 AVI-HT 在真实场景中的表现,我们在包含 100K+ 组对视觉-IMU 样本并同步标注 3D 手部姿态的 DexGloveHOI 数据集上开展了大规模实验,数据集中用户在日常任务中操作各种物体。我们与多种单模态和多模态跟踪方法进行比较,分别使用 UmeTrack 和 MANO 两个手部模型。结果表明,AVI-HT 在基线方法上将平均关键点误差降低了 16.1%,其手腕对齐变体降低了 24.2%。消融实验进一步揭示了 IMU 传感器在不同活动类型下的各手指贡献,以及模型对 IMU 噪声和视觉-IMU 融合中时间错位的敏感性。
引用
@article{arxiv.2605.21714,
title = {AVI-HT: Adaptive Vision-IMU Fusion for 3D Hand Tracking},
author = {Ziyi Kou and Ankit Kumar and Mia Huang and Taylor Niehues and Vatsal Mehta and Ergys Ristani and Li Guan},
journal= {arXiv preprint arXiv:2605.21714},
year = {2026}
}