中文

通过学习语义增强难负样本改进视觉-语义嵌入用于跨模态信息检索

计算机视觉与模式识别 2023-02-15 v4 信息检索

摘要

视觉语义嵌入(VSE)旨在提取图像及其描述的语义,并将其嵌入同一潜空间以用于跨模态信息检索。大多数现有 VSE 网络采用难负样本损失函数进行训练,该函数学习相关与无关图像-描述嵌入对相似度之间的目标间隔。然而,难负样本损失函数中的目标间隔被设为固定超参数,忽略了无关图像-描述对的语义差异。为应对在获得训练好的 VSE 网络之前度量图像-描述对最优相似度的挑战,本文提出一种包含两部分的新型方法:(1) 发掘图像描述的潜在语义;(2) 提出一种新颖的语义增强难负样本损失函数,其学习目标基于无关图像-描述对之间的最优相似度分数动态确定。通过将所提方法集成到五个最先进的 VSE 网络并应用于三个基准数据集的跨模态信息检索任务,进行了大量实验。结果表明所提方法取得了最佳性能,且可被现有及未来的 VSE 网络采用。

关键词

引用

@article{arxiv.2210.04754,
  title  = {Improving Visual-Semantic Embeddings by Learning Semantically-Enhanced Hard Negatives for Cross-modal Information Retrieval},
  author = {Yan Gong and Georgina Cosma},
  journal= {arXiv preprint arXiv:2210.04754},
  year   = {2023}
}