通过语义自监督学习无监督视觉定位
计算机视觉与模式识别
2018-11-20 v3
摘要
在图像中定位自然语言短语是一个极具挑战性的问题,需要对文本和视觉两种模态进行联合理解。在无监督设置下,监督信号的缺失加剧了这一困难。在本文中,我们提出了一种用于无监督视觉定位的新框架,该框架使用概念学习作为代理任务来获取自监督。该想法背后的简单直觉是鼓励模型定位到能够解释数据中某些语义属性的区域,在我们的情况下,该属性即为一组图像中某个概念的存在。我们进行了详尽的定量和定性实验以证明我们方法的有效性,并表明在 Visual Genome 数据集上较当前最优水平提升了 5.6%,在 ReferItGame 数据集上提升了 5.8%,在 Flickr30k 数据集上取得了与最优水平相当的性能。
引用
@article{arxiv.1803.06506,
title = {Learning Unsupervised Visual Grounding Through Semantic Self-Supervision},
author = {Syed Ashar Javed and Shreyas Saxena and Vineet Gandhi},
journal= {arXiv preprint arXiv:1803.06506},
year = {2018}
}
备注
NIPS Workshop 2018