主动挖掘样本对语义用于图文匹配
计算机视觉与模式识别
2023-11-10 v1
摘要
近来,常识学习已成为图文匹配中的热点。尽管其能描述更多图形关联,常识学习仍存在一些不足:1)现有方法基于三元组语义相似度度量损失,无法有效匹配图文样本对中难处理的负样本。2)模型泛化能力弱导致在大规模数据集上图像与文本匹配效果差。针对这些不足,本文提出一种新颖的图文匹配模型,称为主动挖掘样本对语义图文匹配模型(AMSPS)。与具有三元组损失函数的常识学习模型的单一语义学习模式相比,AMSPS是一种主动学习思路。首先,所提出的自适应分层强化损失(AHRL)具有多样化学习模式。其主动学习模式使模型更关注难处理的负样本以增强判别能力。此外,AMSPS还能自适应地从无标注项中挖掘更多隐藏的相关语义表示,极大提升了模型的性能与泛化能力。在Flickr30K与MSCOCO通用数据集上的实验结果表明,我们所提方法优于先进的对比方法。
引用
@article{arxiv.2311.05425,
title = {Active Mining Sample Pair Semantics for Image-text Matching},
author = {Yongfeng Chena and Jin Liua and Zhijing Yang and Ruihan Chena and Junpeng Tan},
journal= {arXiv preprint arXiv:2311.05425},
year = {2023}
}