基于二值与连续标签监督的图像-文本检索
计算机视觉与模式识别
2022-10-21 v1 多媒体
摘要
多数图像-文本检索工作采用二值标签指示图像与文本对是否匹配。此类二值指示仅覆盖图像-文本语义关系的有限子集,不足以表示由连续标签(如图像描述)刻画的图像与文本间的相关程度。通过二值标签学习得到的视觉-语义嵌入空间是不一致的,无法充分刻画相关程度。除使用二值标签外,本文进一步引入连续伪标签(通常由描述间文本相似度近似)以指示相关程度。为学习一致的嵌入空间,我们提出一种具有二值与连续标签监督(BCLS)的图像-文本检索框架,其中二值标签引导检索模型学习有限的二值关联,连续标签则补充图像-文本语义关系的学习。对于二值标签学习,我们改进常用的三元组排序损失,引入软负样本挖掘(Triplet-SN)以改善收敛。对于连续标签学习,我们受Kendall秩相关系数启发设计Kendall排序损失(Kendall),提升了检索模型预测相似度分数与连续标签间的相关性。为缓解连续伪标签引入的噪声,我们进一步设计滑动窗口采样与难样本挖掘策略(SW-HS)以减轻噪声影响,并将框架复杂度降至与三元组排序损失同数量级。在两个图像-文本检索基准上的大量实验表明,我们的方法能提升最先进图像-文本检索模型的性能。
引用
@article{arxiv.2210.11319,
title = {Image-Text Retrieval with Binary and Continuous Label Supervision},
author = {Zheng Li and Caili Guo and Zerun Feng and Jenq-Neng Hwang and Ying Jin and Yufeng Zhang},
journal= {arXiv preprint arXiv:2210.11319},
year = {2022}
}
备注
13 pages, 7 figures