中文

探索自注意力用于视觉路口分类

计算机视觉与模式识别 2022-03-29 v1

摘要

在机器人视觉中,自注意力近来作为一种捕捉非局部上下文的技术而出现。在本研究中,我们将自注意力机制引入路口识别系统,作为捕捉场景背后非局部上下文的方法。一个路口分类系统由两个不同的模块组成:(a)第一人称视觉(FPV)模块,其在经过路口时使用一段短的自我中心视角序列;(b)第三人称视觉(TPV)模块,其在进入路口前立即使用单张视图。自注意力机制在 TPV 模块中有效,因为局部模式的大部分(如道路边缘、建筑物和天空)彼此相似,因此使用非局部上下文(如路口周围两个对角之间的夹角)将是有效的。本研究作出三点主要贡献。首先,我们提出了一种基于自注意力的使用 TPV 的路口分类方法。其次,我们呈现了一个实用系统,其中基于自注意力的 TPV 模块与 FPV 模块相结合以提升整体识别性能。最后,使用公开 KITTI 数据集的实验表明,上述基于自注意力的系统优于基于局部模式的传统识别以及基于卷积运算的识别。

关键词

引用

@article{arxiv.2203.13977,
  title  = {Exploring Self-Attention for Visual Intersection Classification},
  author = {Haruki Nakata and Kanji Tanaka and Koji Takeda},
  journal= {arXiv preprint arXiv:2203.13977},
  year   = {2022}
}

备注

7 pages, 6 figures, technical report