负样本各有其负:为图文检索定制负句子
计算机视觉与模式识别
2021-11-08 v1 计算与语言
信息检索
摘要
匹配模型是图文检索框架的核心。现有研究通常用三元组损失训练模型,并探索多种策略在数据集中检索困难负句子。我们认为,当前基于检索的负样本构建方法受限于数据集规模,因而无法为每张图像识别出高难度的负样本。我们提出 TAiloring neGative Sentences with Discrimination and Correction (TAGS-DC),自动生成合成句子作为负样本。TAGS-DC 由掩码与填充组成,以生成难度更高的合成负句子。为在训练中保持难度,我们通过参数共享使检索与生成相互提升。为进一步利用负句子中不匹配的细粒度语义,我们提出两个辅助任务,即词判别与词纠正,以改进训练。实验中,我们在 MS-COCO 与 Flickr30K 上对比当前最先进模型验证了本模型的有效性,并在进一步分析中展示了其鲁棒性与忠实性。我们的代码可在 https://github.com/LibertFan/TAGS 获取。
引用
@article{arxiv.2111.03349,
title = {Negative Sample is Negative in Its Own Way: Tailoring Negative Sentences for Image-Text Retrieval},
author = {Zhihao Fan and Zhongyu Wei and Zejun Li and Siyuan Wang and Jianqing Fan},
journal= {arXiv preprint arXiv:2111.03349},
year = {2021}
}