MAGNet:基于多区域注意力辅助的短语级自然语言查询定位
计算机视觉与模式识别
2020-06-09 v1 计算与语言
机器学习
摘要
定位自由形式文本查询需要理解这些文本短语及其与视觉线索的关系,以可靠地推理所描述的位置。空间注意力网络已知可学习这种关系并将视线聚焦于图像中的显著对象。因此,我们提出利用空间注意力网络进行图像级视觉–文本融合,保留局部(词)和全局(短语)信息,以通过网内区域提议网络(RPN)细化区域提议,并检测短语查询的单个或多个区域。我们仅关注短语查询–真值对(指代表达式),以构建独立于数据集约束(即附加属性、上下文等)的模型。对于此类指代表达式数据集 ReferIt game,我们的多区域注意力辅助定位网络(MAGNet)相比当前最优方法实现了超过 12% 的提升。在缺乏来自图像描述与属性的上下文(Flickr30k Entities 中)时,我们仍取得了与当前最优方法竞争的结果。
引用
@article{arxiv.2006.03776,
title = {MAGNet: Multi-Region Attention-Assisted Grounding of Natural Language Queries at Phrase Level},
author = {Amar Shrestha and Krittaphat Pugdeethosapol and Haowen Fang and Qinru Qiu},
journal= {arXiv preprint arXiv:2006.03776},
year = {2020}
}
备注
Submitted to The 2020 European Conference on Computer Vision (ECCV 2020)