中文

牧场上的 CoW:语言驱动零样本物体导航的基线与方法基准

计算机视觉与模式识别 2022-12-15 v2 机器学习 机器人学

摘要

为了让机器人具有普遍实用性,它们必须能够找到人们描述的任意物体(即语言驱动),即便没有在域内数据上进行昂贵的导航训练(即执行零样本推断)。我们在一个统一设定中探索这些能力:语言驱动零样本物体导航(L-ZSON)。受近期开放词汇模型在图像分类上成功的启发,我们研究了一个直接框架——轮上的 CLIP(CoW),以在不微调的情况下将开放词汇模型适配到该任务。为了更好地评估 L-ZSON,我们引入了 Pasture 基准,其考虑寻找不常见物体、由空间与外观属性描述的物体,以及相对于可见物体描述的隐藏物体。我们通过在 Habitat、RoboTHOR 和 Pasture 上直接部署 21 个 CoW 基线进行了深入的实证研究。总计我们评估了超过 9 万次导航回合,发现 (1) CoW 基线常常难以利用语言描述,但擅长寻找不常见物体。(2) 一个简单的 CoW,采用基于 CLIP 的物体定位与经典探索——且无额外训练——在 Habitat MP3D 数据上匹配了训练 5 亿步的 SOTA ZSON 方法的导航效率。同一个 CoW 相对于 SOTA RoboTHOR ZSON 模型在成功率上提供了 15.6 个百分点的提升。

关键词

引用

@article{arxiv.2203.10421,
  title  = {CoWs on Pasture: Baselines and Benchmarks for Language-Driven Zero-Shot Object Navigation},
  author = {Samir Yitzhak Gadre and Mitchell Wortsman and Gabriel Ilharco and Ludwig Schmidt and Shuran Song},
  journal= {arXiv preprint arXiv:2203.10421},
  year   = {2022}
}