用于跨模态检索的自监督视觉表示
计算机视觉与模式识别
2019-02-04 v1
摘要
近年来,借助深度神经网络和 ImageNet、Places 等大规模标注数据集,跨模态检索方法取得了显著改进。然而,收集和标注此类数据集需要巨大的人力,且它们的标注通常局限于离散的流行视觉类别集合,可能无法代表大规模跨模态检索数据集中更丰富的语义。本文提出一种自监督跨模态检索框架,利用整个维基百科文章集中图像与文本的相关性作为训练数据。我们的方法训练一个 CNN 来预测:(1) 一幅图像更可能作为插图出现的文章语义上下文(全局上下文);(2) 其图注的语义上下文(局部上下文)。实验表明,所提方法不仅能学习用于解决图像分类和目标检测等视觉任务的判别性视觉表示,而且与在 ImageNet 数据集上监督预训练网络相比,所学表示更适用于跨模态检索。
引用
@article{arxiv.1902.00378,
title = {Self-Supervised Visual Representations for Cross-Modal Retrieval},
author = {Yash Patel and Lluis Gomez and Marçal Rusiñol and Dimosthenis Karatzas and C. V. Jawahar},
journal= {arXiv preprint arXiv:1902.00378},
year = {2019}
}
备注
arXiv admin note: text overlap with arXiv:1807.02110