面向视觉-语言检索的成对相似度优化统一损失
计算机视觉与模式识别
2022-11-08 v2 多媒体
摘要
视觉-语言检索中常用的两种损失函数为三元组损失与对比学习损失,二者本质上均最小化负样本对与正样本对相似度之差。更具体地,广泛用于现有检索模型以提升判别能力的带难负样本挖掘的三元组损失(Triplet-HN)在训练中易陷入局部极小。另一方面,广泛用于视觉-语言预训练的视觉-语言对比学习损失(VLC)已被证明在视觉-语言检索上取得显著性能提升,但使用 VLC 在小数据集上微调的性能不尽如人意。本文提出一种面向视觉-语言检索的成对相似度优化统一损失,为理解现有损失函数提供了有力工具。我们的统一损失包含了 VLC 的难样本挖掘策略,并引入三元组损失所用的间隔以实现更好的相似度分离。结果表明,Triplet-HN 与 VLC 均为我们统一损失的特殊形式。与 Triplet-HN 相比,我们的统一损失具有更快的收敛速度。与 VLC 相比,我们的统一损失更具判别性,并能在下游微调任务中提供更好的泛化能力。在图像-文本与视频-文本检索基准上的实验表明,我们的统一损失能显著提升最先进(state-of-the-art)检索模型的性能。
引用
@article{arxiv.2209.13869,
title = {Unified Loss of Pair Similarity Optimization for Vision-Language Retrieval},
author = {Zheng Li and Caili Guo and Xin Wang and Zerun Feng and Jenq-Neng Hwang and Zhongtian Du},
journal= {arXiv preprint arXiv:2209.13869},
year = {2022}
}
备注
16 pages, 5 figures