视觉-声学手部姿态与接触估计
人机交互
2025-08-25 v1 计算机视觉与模式识别
机器学习
机器人学
摘要
准确估计手部姿态和手-物体接触事件对于机器人数据采集、沉浸式虚拟环境和生物力学分析至关重要,但由于视觉遮挡、微妙的接触线索、纯视觉感知的局限性以及缺乏可及且灵活的触觉感知,这仍然具有挑战性。因此,我们引入了VibeMesh,一种新颖的可穿戴系统,它将视觉与主动声学感知融合在一起,用于密集的、逐顶点的的手部接触和姿态估计。VibeMesh集成了一个骨传导扬声器和稀疏的压电麦克风,分布在人手上,发射结构化的声学信号并捕获其传播,以推断接触引起的变化。为了解释这些跨模态信号,我们提出了一种基于图的注意力网络,该网络处理同步的音频频谱和从RGB-D导出的手部网格,以高空间分辨率预测接触。我们的贡献包括:(i)一个轻量级、非侵入式的视觉-声学感知平台;(ii)一个用于联合姿态和接触推断的跨模态图网络;(iii)一个包含跨多种操作场景的同步RGB-D、声学和真实接触标注的数据集;(iv)实证结果表明,VibeMesh在准确性和鲁棒性方面优于纯视觉基线,尤其是在遮挡或静态接触场景中。
引用
@article{arxiv.2508.00852,
title = {Visuo-Acoustic Hand Pose and Contact Estimation},
author = {Yuemin Mao and Uksang Yoo and Yunchao Yao and Shahram Najam Syed and Luca Bondi and Jonathan Francis and Jean Oh and Jeffrey Ichnowski},
journal= {arXiv preprint arXiv:2508.00852},
year = {2025}
}