用于图文检索的模态内约束损失
计算机视觉与模式识别
2022-07-14 v2 多媒体
摘要
跨模态检索在计算机视觉和自然语言处理领域都引起了广泛关注。随着卷积和循环神经网络的发展,跨图像-文本模态检索的瓶颈已不再是图像与文本特征的提取,而是嵌入空间中高效的损失函数学习。许多损失函数试图拉近来自异质模态的成对特征。本文提出一种使用模态内约束损失函数学习图像与文本联合嵌入的方法,以减少来自同一同质模态的负样本对的违例。实验结果表明,我们的方法在 Flickr30K 和 Microsoft COCO 数据集上优于最先进的双向图文检索方法。我们的代码公开可用:https://github.com/CanonChen/IMC。
引用
@article{arxiv.2207.05024,
title = {Intra-Modal Constraint Loss For Image-Text Retrieval},
author = {Jianan Chen and Lu Zhang and Qiong Wang and Cong Bai and Kidiyo Kpalma},
journal= {arXiv preprint arXiv:2207.05024},
year = {2022}
}