面向图文匹配的自适应离线五元组损失
计算机视觉与模式识别
2020-07-23 v3
摘要
现有的图文匹配方法通常利用带在线难负样本的三元组损失来训练模型。对于训练小批量中的每个图像或文本锚点,模型被训练以区分从迷你批次中挖掘出的该锚点的一个正样本与最易混淆的负样本(即在线难负样本)。该策略提升了模型发现图像与文本输入之间细粒度对应与非对应关系的能力。然而,上述方法存在以下缺陷:(1)负样本选择策略仍为模型从极难区分的案例中学习提供了有限的机会。(2)训练好的模型从训练集到测试集的泛化能力较弱。(3)惩罚对于具有不同“难度”程度的难负样本缺乏层次性与自适应性。在本文中,我们通过对整个训练集离线采样负样本来提出解决方案。其提供了比在线难负样本“更难”的离线负样本供模型区分。基于离线难负样本,提出一种五元组损失以提升模型区分正负样本的泛化能力。此外,创建了一种结合正样本、离线难负样本与在线难负样本知识的新损失函数。它利用离线难负样本作为中介,基于其与锚点的距离关系来自适应地惩罚它们。我们在 MS-COCO 与 Flickr30K 数据集上基于三个最先进的图文模型评估所提出的训练方法。所有模型均观察到显著的性能提升,证明了我们方法的有效性与通用性。代码见 https://github.com/sunnychencool/AOQ
引用
@article{arxiv.2003.03669,
title = {Adaptive Offline Quintuplet Loss for Image-Text Matching},
author = {Tianlang Chen and Jiajun Deng and Jiebo Luo},
journal= {arXiv preprint arXiv:2003.03669},
year = {2020}
}
备注
Accepted by ECCV 2020. Code is available at https://github.com/sunnychencool/AOQ