中文

将语言指令定位至可行驶区域

计算机视觉与模式识别 2021-12-28 v1 机器人学

摘要

人类拥有一种天然能力,能够毫不费力地理解诸如“停在黄色轿车旁边”之类的语言指令,并本能地知道车辆应当行驶到道路上的哪个区域。将这种能力赋予自动驾驶车辆,是迈向创造能够依据人类指令作出响应与行动的全自主智能体的下一步。为此,我们提出了一种新颖任务——指称可行驶区域(Referring Navigable Regions, RNR),即基于语言指令为导航定位感兴趣区域。RNR不同于指称图像分割(Referring Image Segmentation, RIS),后者侧重于定位自然语言表述所指的物体,而非定位可行驶区域。例如,对于指令“停在黄色轿车旁边”,RIS旨在分割所指的轿车,而RNR旨在分割道路上建议的停车区域。我们引入了一个新数据集Talk2Car-RegSeg,它在现有Talk2car数据集的基础上,为语言指令所描述的区域添加了分割掩码。我们还提供了一个独立的测试划分,其包含简洁的面向机动操作的指令,以评估数据集的实用性。我们使用一种新颖的基于Transformer的架构对所提数据集进行了基准测试。我们给出了大量消融实验,并在多个评价指标上展示了优于基线的性能。一个基于RNR输出生成轨迹的下游路径规划器证实了所提框架的有效性。

关键词

引用

@article{arxiv.2112.13031,
  title  = {Grounding Linguistic Commands to Navigable Regions},
  author = {Nivedita Rufus and Kanishk Jain and Unni Krishnan R Nair and Vineet Gandhi and K Madhava Krishna},
  journal= {arXiv preprint arXiv:2112.13031},
  year   = {2021}
}