度量学习的经验能否推广到图文检索?
计算机视觉与模式识别
2022-02-16 v1 人工智能
信息检索
摘要
采用半困难负样本的三元组损失已成为从头优化的图文检索(ICR)方法的事实标准选择。度量学习的最新进展催生了在图像检索和表示学习等任务上优于三元组损失的新损失函数。我们通过在两种ICR方法上比较三种损失函数,探究这些发现是否能推广至ICR设定。我们对此给出否定回答:在ICR任务上,采用半困难负样本挖掘的三元组损失仍优于度量学习中新引入的损失函数。为更好理解这些结果,我们引入一种分析方法,通过统计优化过程中对查询表示梯度有贡献的样本数量来比较损失函数。我们发现,在ICR任务上评估分数较低的损失函数,通常在计算查询表示梯度时考虑了过多(非信息性)样本,从而导致次优性能。研究表明,采用半困难负样本的三元组损失优于其他损失函数,因其在计算梯度时仅考虑一个(困难)负样本。
引用
@article{arxiv.2202.07474,
title = {Do Lessons from Metric Learning Generalize to Image-Caption Retrieval?},
author = {Maurits Bleeker and Maarten de Rijke},
journal= {arXiv preprint arXiv:2202.07474},
year = {2022}
}
备注
Accepted to ECIR 2022 Reproducibility track