中文

OVGrasp:基于多模态意图检测的开放词汇抓取辅助

机器人学 2025-09-05 v1 计算机视觉与模式识别

摘要

抓取辅助对于恢复运动障碍个体的自主性至关重要,特别是在物体类别和用户意图多样且不可预测的非结构化环境中。我们提出了OVGrasp,这是一个用于软外骨骼抓取辅助的分层控制框架,它集成了RGB-D视觉、开放词汇提示和语音命令,以实现稳健的多模态交互。为了增强在开放环境中的泛化能力,OVGrasp结合了具有开放词汇机制的视觉-语言基础模型,允许在无需重新训练的情况下对先前未见的物体进行零样本检测。多模态决策器进一步融合空间和语言线索,以在多物体场景中推断用户意图,例如抓取或释放。我们在定制的第一视角可穿戴外骨骼上部署了完整的框架,并在三种抓取类型下对15个物体进行了系统评估。十名参与者的实验结果表明,OVGrasp的抓取能力评分(GAS)达到87.00%,优于SOTA基线方法,并实现了与自然手部运动更好的运动学对齐。

关键词

引用

@article{arxiv.2509.04324,
  title  = {OVGrasp: Open-Vocabulary Grasping Assistance via Multimodal Intent Detection},
  author = {Chen Hu and Shan Luo and Letizia Gionfrida},
  journal= {arXiv preprint arXiv:2509.04324},
  year   = {2025}
}