中文

基于网格-词交叉注意力的无候选框单阶段指代表达理解

计算机视觉与模式识别 2021-05-06 v1

摘要

指代表达理解(REC)已成为视觉推理中最重要的任务之一,因为它是视觉问答等许多视觉-语言任务的关键步骤。然而,它尚未在诸多下游任务中广泛使用,因为其存在以下缺陷:1)两阶段方法计算开销大且存在不可避免的误差累积;2)单阶段方法必须依赖大量超参数(如锚框)来生成边界框。本文提出一种无候选框单阶段(PFOS)模型,能够基于文本查询以端到端方式从图像中回归感兴趣区域。我们未采用主流的锚框候选范式,而是直接将图像的密集网格作为输入,送入一个学习网格-词对应关系的交叉注意力 transformer。最终的边界框直接从图像预测得出,无需此前方法所承受的耗时锚框选择过程。与以往最佳的单阶段和两阶段方法相比,我们的模型在四个指代表达数据集上以更高效率取得了 SOTA 性能。

关键词

引用

@article{arxiv.2105.02061,
  title  = {Proposal-free One-stage Referring Expression via Grid-Word Cross-Attention},
  author = {Wei Suo and Mengyang Sun and Peng Wang and Qi Wu},
  journal= {arXiv preprint arXiv:2105.02061},
  year   = {2021}
}

备注

To be published in the 30th International Joint Conference on Artificial Intelligence (IJCAI-2021)