中文

带碰撞缓解的零样本视觉语言导航

计算机视觉与模式识别 2024-10-24 v1 人工智能

摘要

我们提出了带碰撞缓解的零样本视觉语言导航(Vision-and-Language Navigation with Collision Mitigation, VLN-CM),该方法考虑了上述因素。VLN-CM由四个模块组成,在每一步预测下一步的方向和距离。我们利用大型基础模型处理每个模块。为选择方向,我们使用注意力点预测器(Attention Spot Predictor, ASP)、视图选择器(View Selector, VS)和进度监视器(Progress Monitor, PM)。ASP采用大型语言模型(如ChatGPT)将导航指令划分为注意力点,这些注意力点是位于要移动到的位置的对象或场景(例如一扇黄色的门)。VS从以30度间隔提供的全景图像中选择包含注意力点的那个图像,并将所选图像的角度作为前进的方向。PM采用基于规则的方法,在来自指令派生的多个注意力点中决定下一个要关注的注意力点。如果当前注意力点与视觉观察之间的相似性在每一步都连续下降,PM会确定该代理已经越过当前注意力点并移动到下一个注意力点。为选择移动距离,我们采用了开放地图预测器(Open Map Predictor, OMP)。OMP使用全景深度信息预测占据掩码,然后根据占据掩码在预测的方向上选择一个无碰撞的距离。我们使用VLN-CE的验证数据对方法进行评估。我们的做法在多个基线方法方面表现更好,OPM在减轻代理的碰撞方面效果良好。

关键词

引用

@article{arxiv.2410.17267,
  title  = {Zero-Shot Vision-and-Language Navigation with Collision Mitigation in Continuous Environment},
  author = {Seongjun Jeong and Gi-Cheon Kang and Joochan Kim and Byoung-Tak Zhang},
  journal= {arXiv preprint arXiv:2410.17267},
  year   = {2024}
}