AsCL:面向图像-文本检索的数据不对称对比学习方法
多媒体
2024-05-20 v2
摘要
图像-文本检索任务旨在从给定的图像或文本中检索相关信息。其主要挑战在于统一多模态表征并区分跨模态的细粒度差异,从而找到相似内容并过滤无关内容。然而,现有方法主要关注多模态的统一语义表征和概念对齐,而跨模态的细粒度差异几乎未受到研究,这使得难以解决信息不对称问题。本文提出一种新颖的非对称敏感对比学习方法。通过为不同类型的非对称生成对应的正负样本,本方法能够同时确保跨模态之间的细粒度语义差异和统一语义表征。此外,还提出了一种层次化的跨模态融合方法,该方法通过多模态注意力机制整合全局和局部级别的特征,以实现概念对齐。在MS COCO和Flickr30K上的大量实验表明,我们所提出方法的有效性和优越性。
引用
@article{arxiv.2405.10029,
title = {AsCL: An Asymmetry-sensitive Contrastive Learning Method for Image-Text Retrieval with Cross-Modal Fusion},
author = {Ziyu Gong and Chengcheng Mai and Yihua Huang},
journal= {arXiv preprint arXiv:2405.10029},
year = {2024}
}
备注
This work has been strong-accepted as the oral conference paper by IEEE International Conference on Multimedia & Expo (ICME) 2024