中文

通过分离实现无检测器的弱监督定位

计算机视觉与模式识别 2021-04-21 v1

摘要

如今,存在大量涉及图像及与之弱对应的周边自由文本形式的数据。弱监督短语定位(WSG)致力于利用此类数据学习在图像中定位(或接地)任意文本短语,而无需任何额外标注。然而,多数近期 WSG 的 SOTA 方法假设存在预训练的目标检测器,并依赖其生成用于定位的 ROI。在本工作中,我们聚焦于无检测器 WSG(DF-WSG)任务,以在不依赖预训练检测器的前提下解决 WSG。我们直接从图像及关联的自由文本对中学习一切,从而潜在地在不被检测器支持的类别上获得优势。我们提出的通过分离定位(GbS)方法的核心思想在于:通过对任意图像对进行随机 alpha 混合来合成“文本到图像区域”的关联,并使用该图像对对应的文本作为条件,通过分割网络从混合图像中恢复 alpha 图。在测试时,这允许将查询短语作为非混合查询图像的条件,从而将该测试图像解释为对应于该短语的区域与互补区域的组合。利用该方法,我们在包括 Flickr30K、Visual Genome 与 ReferIt 在内的一系列基准上,相较先前 DF-WSG SOTA 取得了显著的精度提升(高达 8.5%8.5\%),并相较基于检测器的 WSG 方法取得了显著的互补提升( above 7%7\%)。

关键词

引用

@article{arxiv.2104.09829,
  title  = {Detector-Free Weakly Supervised Grounding by Separation},
  author = {Assaf Arbelle and Sivan Doveh and Amit Alfassy and Joseph Shtok and Guy Lev and Eli Schwartz and Hilde Kuehne and Hila Barak Levi and Prasanna Sattigeri and Rameswar Panda and Chun-Fu Chen and Alex Bronstein and Kate Saenko and Shimon Ullman and Raja Giryes and Rogerio Feris and Leonid Karlinsky},
  journal= {arXiv preprint arXiv:2104.09829},
  year   = {2021}
}