三思而后行:面向单阶段视觉定位的地标特征学习
计算机视觉与模式识别
2021-04-12 v1
摘要
本文提出一种用于端到端可训练单阶段视觉定位的 LBYL(「Look Before You Leap」,三思而后行)网络。LBYL-Net 背后的思想直观而直接:我们依据语言描述,基于目标对象相对于「地标」的相对空间关系来定位目标对象,该关系由若干空间位置词和关于该对象的描述词刻画。我们 LBYL-Net 的核心是一个地标特征卷积模块,它在不同方向上以语言描述为引导来传递视觉特征。因此,该模块编码了当前对象与其上下文之间的相对空间位置关系。随后我们将来自地标特征卷积模块的上下文信息与目标对象的视觉特征结合用于定位。为使该地标特征卷积轻量化,我们引入了一种低复杂度的动态规划算法(称为动态最大池化)来提取地标特征。得益于地标特征卷积模块,我们模仿人类「三思而后行」的行为设计了 LBYL-Net,其充分考虑了上下文信息。大量实验表明了我们的方法在四个定位数据集上的有效性。具体而言,我们的 LBYL-Net 在 ReferitGame 上优于所有 SOTA 的两阶段和单阶段方法。在 RefCOCO 和 RefCOCO+ 上,我们的 LBYL-Net 也取得了与现有单阶段方法相当甚至更好的结果。
引用
@article{arxiv.2104.04386,
title = {Look Before You Leap: Learning Landmark Features for One-Stage Visual Grounding},
author = {Binbin Huang and Dongze Lian and Weixin Luo and Shenghua Gao},
journal= {arXiv preprint arXiv:2104.04386},
year = {2021}
}
备注
Code is available at https://github.com/svip-lab/LBYLNet