不止于注意力:以对比约束改进跨模态注意力用于图像-文本匹配
计算机视觉与模式识别
2022-10-05 v3
摘要
跨模态注意力机制已广泛应用于图像-文本匹配任务,并因其学习跨模态细粒度相关性能力而取得显著改进。然而,现有方法的跨模态注意力模型可能次优且不精确,因为训练过程中未提供直接监督。本工作中,我们提出两种新颖训练策略,即对比内容重源(CCR)与对比内容交换(CCS)约束,以解决此类局限。这些约束以对比学习方式监督跨模态注意力模型训练,无需显式注意力标注。它们为插件式训练策略,可轻松集成至现有跨模态注意力模型。此外,我们引入包括注意力精确率、召回率与F1分数在内的三个指标,定量度量所学注意力模型的质量。通过将所提约束融入四种最先进的基于跨模态注意力的图像-文本匹配模型来评估它们。在Flickr30k与MS-COCO数据集上的实验结果表明,集成这些约束在检索性能与注意力指标两方面均提升了模型表现。
引用
@article{arxiv.2105.09597,
title = {More Than Just Attention: Improving Cross-Modal Attentions with Contrastive Constraints for Image-Text Matching},
author = {Yuxiao Chen and Jianbo Yuan and Long Zhao and Tianlang Chen and Rui Luo and Larry Davis and Dimitris N. Metaxas},
journal= {arXiv preprint arXiv:2105.09597},
year = {2022}
}
备注
Accepted to WACV 2023