HiFi-CS:利用视觉-语言模型迈向开放词汇的机器人抓取视觉定位
机器人学
2025-03-14 v2 人工智能
摘要
通过自然语言与人类交互的机器人能够解锁众多应用,例如指代抓取合成(RGS)。给定一段文本查询,RGS确定一个稳定的抓取位姿,以操纵机器人工作空间中被指代的物体。RGS包含两个步骤:视觉定位和抓取位姿估计。近期的研究利用强大的视觉-语言模型(VLM)将自由流畅的自然语言视觉定位到真实世界的机器人执行中。然而,在具有同一物体多个实例的复杂、杂乱环境中仍缺乏比较。本文介绍了HiFi-CS,其特征是分层应用特征级线性调制来融合图像和文本嵌入,从而增强机器人抓取中遇到的复杂且富含属性文本查询的视觉定位。视觉定位将2D/3D空间中的物体与自然语言输入相关联,并在两种场景下进行研究:闭集词汇和开放词汇。HiFi-CS结合了轻量级解码器与冻结的VLM,在闭集词汇设置下优于具有竞争力的基线,且模型尺寸小100倍。我们的模型能够有效引导如GroundedSAM等开放集目标检测器,以增强开放词汇性能。我们通过使用7自由度机械臂进行真实世界的RGS实验验证了该方法,在15个桌面场景中实现了90.33%的视觉定位准确率。我们的代码库在此提供:https://github.com/vineet2104/hifics
引用
@article{arxiv.2409.10419,
title = {HiFi-CS: Towards Open Vocabulary Visual Grounding For Robotic Grasping Using Vision-Language Models},
author = {Vineet Bhat and Prashanth Krishnamurthy and Ramesh Karri and Farshad Khorrami},
journal= {arXiv preprint arXiv:2409.10419},
year = {2025}
}