面向弱监督视觉定位的关系感知实例精炼
计算机视觉与模式识别
2021-03-25 v1
摘要
视觉定位旨在建立视觉对象与其语言实体之间的对应,是跨模态场景理解的关键。一种有前景且可扩展的视觉定位学习策略是利用仅来自图像-描述对的弱监督。以往方法通常依赖于将查询短语直接匹配到预先计算、固定的对象候选池,由于缺乏语义关系约束,导致定位不准确与匹配模糊。在本文中,我们提出一种新颖的上下文感知弱监督学习方法,将由粗到细的对象精炼与实体关系建模纳入两阶段深度网络,能够生成更精确的对象表示与匹配。为有效训练我们的网络,我们引入了针对候选区域位置的自学习回归损失以及基于解析实体关系的分类损失。在Flickr30K Entities和ReferItGame两个公开基准上的大量实验证明了我们弱监督定位框架的有效性。结果显示,我们以显著优势超越以往方法,在Flickr30K Entities中达到59.27%的top-1准确率,在ReferItGame数据集中达到37.68%(代码见 https://github.com/youngfly11/ReIR-WeaklyGrounding.pytorch.git)。
引用
@article{arxiv.2103.12989,
title = {Relation-aware Instance Refinement for Weakly Supervised Visual Grounding},
author = {Yongfei Liu and Bo Wan and Lin Ma and Xuming He},
journal= {arXiv preprint arXiv:2103.12989},
year = {2021}
}
备注
Accepted by CVPR2021