中文

自动驾驶车辆指令(C4AV)研讨会综述

计算机视觉与模式识别 2020-09-21 v1 人工智能

摘要

视觉定位任务要求根据给定的自然语言查询在图像中定位最相关的区域或物体。迄今为止,该任务的进展主要在精心整理的数据集上衡量,这些数据集并不总是能代表人类口语表达。在本工作中,我们偏离近期流行的任务设定,考虑在自动驾驶车辆场景下的该问题。具体而言,我们考虑一种情形:乘客可以向车辆发出自由形式的自然语言指令,这些指令可与街道场景中的某个物体相关联。为激发对此主题的研究,我们基于近期的 Talk2Car 数据集(URL: https://www.aicrowd.com/challenges/eccv-2020-commands-4-autonomous-vehicles)组织了 Commands for Autonomous Vehicles(C4AV)挑战赛。本文展示了该挑战赛的结果。首先,我们将所用基准与现有视觉定位数据集进行比较。其次,我们识别出使性能最优模型成功的关键因素,并将其与现有的视觉定位 SOTA 模型相关联,此外还通过在对精心挑选的子集上进行评估来检测潜在的失败案例。最后,我们讨论了未来工作的若干可能性。

关键词

引用

@article{arxiv.2009.08792,
  title  = {Commands 4 Autonomous Vehicles (C4AV) Workshop Summary},
  author = {Thierry Deruyttere and Simon Vandenhende and Dusan Grujicic and Yu Liu and Luc Van Gool and Matthew Blaschko and Tinne Tuytelaars and Marie-Francine Moens},
  journal= {arXiv preprint arXiv:2009.08792},
  year   = {2020}
}