中文

面向弱监督指代表达定位的实体增强自适应重构网络

计算机视觉与模式识别 2022-07-19 v1

摘要

弱监督指代表达定位(REG)旨在将语言中描述的特定目标在图像中定位,但缺乏目标与表达间的对应关系。弱监督REG存在两个主要问题。首先,缺乏区域级标注在候选框与查询间引入歧义。其次,以往多数弱监督REG方法忽略所指对象的判别性位置与上下文,导致难以将目标与其他同类别物体区分。为应对上述挑战,我们设计了实体增强自适应重构网络(EARN)。具体而言,EARN包含三个模块:实体增强、自适应定位与协同重构。在实体增强中,我们计算语义相似度作为监督以筛选候选提议。自适应定位借助层次化注意力,基于主体、位置与上下文计算候选提议的排序得分。协同重构从三个角度度量排序结果:自适应重构、语言重构与属性分类。自适应机制有助于缓解不同指代表达的方差。在五个数据集上的实验表明EARN优于现有最先进(state-of-the-art)方法。定性结果显示所提EARN能更好处理多个同类别物体共处的情况。

关键词

引用

@article{arxiv.2207.08386,
  title  = {Entity-enhanced Adaptive Reconstruction Network for Weakly Supervised Referring Expression Grounding},
  author = {Xuejing Liu and Liang Li and Shuhui Wang and Zheng-Jun Zha and Zechao Li and Qi Tian and Qingming Huang},
  journal= {arXiv preprint arXiv:2207.08386},
  year   = {2022}
}

备注

17 pages, 10 figures, accepted by TPAMI. arXiv admin note: text overlap with arXiv:1908.10568