中文

基于单阶段定位网络的实时指代表达理解

计算机视觉与模式识别 2018-12-11 v1

摘要

本文提出一种新颖的端到端模型,即单阶段定位网络(SSG),用于在图像内给定指代表达时定位所指对象。与以往依赖于目标提议或检测区域的多阶段模型不同,我们所提模型旨在通过单一阶段理解指代表达,而无需借助区域提议以及随后的区域级特征提取。具体而言,提出一种多模态交互器,以注意力方式对关于指代表达的局部区域特征进行汇总。随后,提出一个定位器直接在给定图像内定位指代表达。为进一步提高定位精度,提出一种引导注意力机制,迫使定位器聚焦于所指对象的中心区域。此外,通过利用并预测视觉属性信息,定位器可进一步区分图像内的所指对象,从而提升模型性能。在 RefCOCO、RefCOCO+ 和 RefCOCOg 数据集上的实验表明,我们提出的 SSG 在不依赖任何区域提议的情况下,可与其他先进模型取得相当的性能。更重要的是,我们的 SSG 在时间效率上优于以往模型,在 ReferItGame 数据集上取得了当前最优(state-of-art)性能。此外,我们的 SSG 时间高效,在 Nvidia Tesla P40 上平均可在 25ms 内(每秒 40 个所指对象)对来自 RefCOCO 数据集的 416*416 图像完成指代表达定位,比现有多阶段模型加速 9 倍以上。

关键词

引用

@article{arxiv.1812.03426,
  title  = {Real-Time Referring Expression Comprehension by Single-Stage Grounding Network},
  author = {Xinpeng Chen and Lin Ma and Jingyuan Chen and Zequn Jie and Wei Liu and Jiebo Luo},
  journal= {arXiv preprint arXiv:1812.03426},
  year   = {2018}
}