中文

基于 GMM 的全面特征提取与相对距离保持:面向少样本跨模态检索

计算机视觉与模式识别 2025-05-20 v1 信息检索

摘要

少样本跨模态检索旨在利用有限的训练样本学习跨模态表征,从而在推理阶段处理未见过的类别。与传统跨模态检索任务不同,后者假设训练和测试数据共享相同的类别分布,而少样本检索涉及跨模态稀疏表示的数据。现有方法往往无法充分建模少样本跨模态数据的多峰分布,导致潜在语义空间中出现两类主要偏差:类内偏差——稀疏样本未能捕捉类内多样性;类间偏差——图像和文本分布之间的错位加剧了语义间隙。这些偏差限制了检索准确率。为解决上述问题,我们提出一种新方法 GCRDP,用于少样本跨模态检索。该方法利用高斯混合模型(GMM)有效捕捉数据的复杂多峰分布,并引入多正样本对比学习机制实现全面特征建模。此外,我们提出一种新的跨模态语义对齐策略,约束图像和文本特征分布之间的相对距离,从而提升跨模态表征的准确性。我们在四个基准数据集上进行大量实验,证明其在六大最先进方法上均表现出优异性能。

关键词

引用

@article{arxiv.2505.13306,
  title  = {GMM-Based Comprehensive Feature Extraction and Relative Distance Preservation For Few-Shot Cross-Modal Retrieval},
  author = {Chengsong Sun and Weiping Li and Xiang Li and Yuankun Liu and Lianlei Shan},
  journal= {arXiv preprint arXiv:2505.13306},
  year   = {2025}
}