中文

用于鲁棒图文检索的语义保持增强

计算机视觉与模式识别 2023-03-13 v1

摘要

图文检索是一项搜索视觉世界恰当文本描述及其反方向任务。该任务的一个挑战是对输入图像和文本损坏的脆弱性。此类损坏在训练时通常未被观测到,并会大幅降低检索模型的决策质量。本文中,我们提出一种新颖的图文检索技术,称为鲁棒视觉语义嵌入(RVSE),其包含称为图像语义保持增强(SPAugI)和文本语义保持增强(SPAugT)的新型基于图像与基于文本的增强技术。由于 SPAugI 和 SPAugT 以保留语义信息的方式改变原始数据,我们强制特征提取器生成语义感知的嵌入向量而不论损坏与否,从而显著提升模型鲁棒性。在使用基准数据集的大量实验中,我们表明 RVSE 在图文检索性能上优于传统检索方案。

关键词

引用

@article{arxiv.2303.05692,
  title  = {Semantic-Preserving Augmentation for Robust Image-Text Retrieval},
  author = {Sunwoo Kim and Kyuhong Shim and Luong Trung Nguyen and Byonghyo Shim},
  journal= {arXiv preprint arXiv:2303.05692},
  year   = {2023}
}

备注

Accepted to ICASSP 2023