中文

负样本各有其负:为图文检索定制负句子

计算机视觉与模式识别 2021-11-08 v1 计算与语言 信息检索

摘要

匹配模型是图文检索框架的核心。现有研究通常用三元组损失训练模型,并探索多种策略在数据集中检索困难负句子。我们认为,当前基于检索的负样本构建方法受限于数据集规模,因而无法为每张图像识别出高难度的负样本。我们提出 TAiloring neGative Sentences with Discrimination and Correction (TAGS-DC),自动生成合成句子作为负样本。TAGS-DC 由掩码与填充组成,以生成难度更高的合成负句子。为在训练中保持难度,我们通过参数共享使检索与生成相互提升。为进一步利用负句子中不匹配的细粒度语义,我们提出两个辅助任务,即词判别与词纠正,以改进训练。实验中,我们在 MS-COCO 与 Flickr30K 上对比当前最先进模型验证了本模型的有效性,并在进一步分析中展示了其鲁棒性与忠实性。我们的代码可在 https://github.com/LibertFan/TAGS 获取。

关键词

引用

@article{arxiv.2111.03349,
  title  = {Negative Sample is Negative in Its Own Way: Tailoring Negative Sentences for Image-Text Retrieval},
  author = {Zhihao Fan and Zhongyu Wei and Zejun Li and Siyuan Wang and Jianqing Fan},
  journal= {arXiv preprint arXiv:2111.03349},
  year   = {2021}
}