TSVC:面向稳健图像-文本检索的三段式学习与语义变化一致性
计算机视觉与模式识别
2025-06-12 v2 人工智能
摘要
跨模态检索通过语义相关性将不同模态的数据进行映射。现有方法隐含地假设数据对 perfectly 对齐,忽略了广泛存在的注释噪声,即噪声对应关系(噪声对应性)。因此,必然导致性能下降。尽管尝试采用相同架构的 co-teaching 范式提供不同的数据视角,但这些架构之间的差异主要来自随机初始化,随着训练过程的进行,模型变得越来越均匀。因此,这种范式带来的额外信息严重受限。为解决此问题,我们提出一种用于稳健图像-文本检索的三段式学习与语义变化一致性(TSVC)。我们设计了由协调器、主模型和助理模型组成的三段式协作学习机制。协调器分配数据,助理模型通过多样化的数据支持主模型的噪声标签预测。此外,我们引入一种基于互信息变化的软标签估计方法,用于量化新样本中的噪声并分配相应的软标签。我们还提出了一种新型损失函数以增强鲁棒性并优化训练效果。在三个广泛使用的数据集上进行大量实验表明,即使在噪声比例不断增加的情况下,TSVC 在检索准确率方面仍显示显著优势,并保持稳定的训练性能。
引用
@article{arxiv.2501.10935,
title = {TSVC:Tripartite Learning with Semantic Variation Consistency for Robust Image-Text Retrieval},
author = {Shuai Lyu and Zijing Tian and Zhonghong Ou and Yifan Zhu and Xiao Zhang and Qiankun Ha and Haoran Luo and Meina Song},
journal= {arXiv preprint arXiv:2501.10935},
year = {2025}
}
备注
This paper has been accepted to the Main Track of AAAI 2025. It contains 9 pages, 7 figures, and is relevant to the areas of cross-modal retrieval and machine learning. The work presents a novel approach in robust image-text retrieval using a tripartite learning framework