用于弱监督指代表达式定位的自适应重构网络
计算机视觉与模式识别
2019-08-29 v1
摘要
弱监督指代表达式定位旨在根据语言查询定位图像中的指代对象,其中在训练阶段指代对象与查询之间的映射是未知的。为了解决这个问题,我们提出了一种新颖的端到端自适应重构网络(ARN)。它以自适应的方式构建图像候选区域与查询之间的对应关系:自适应定位与协同重构。具体而言,我们首先分别提取主体、位置和上下文特征来表示候选区域和查询。然后,我们设计了自适应定位模块,通过分层注意力模型计算每个候选区域与查询之间的匹配分数。最后,基于注意力分数和候选区域特征,我们利用语言重构损失、自适应重构损失和属性分类损失的协同损失来重构输入查询。这种自适应机制有助于我们的模型减轻不同指代表达式的方差。在四个大规模数据集上的实验表明,ARN以较大优势优于现有的SOTA方法。定性结果证明,所提出的ARN能够更好地处理特定类别的多个对象聚集在一起的情况。
引用
@article{arxiv.1908.10568,
title = {Adaptive Reconstruction Network for Weakly Supervised Referring Expression Grounding},
author = {Xuejing Liu and Liang Li and Shuhui Wang and Zheng-Jun Zha and Dechao Meng and Qingming Huang},
journal= {arXiv preprint arXiv:1908.10568},
year = {2019}
}
备注
Accepted by ICCV 2019