用于鲁棒图文检索的语义保持增强
计算机视觉与模式识别
2023-03-13 v1
摘要
图文检索是一项搜索视觉世界恰当文本描述及其反方向任务。该任务的一个挑战是对输入图像和文本损坏的脆弱性。此类损坏在训练时通常未被观测到,并会大幅降低检索模型的决策质量。本文中,我们提出一种新颖的图文检索技术,称为鲁棒视觉语义嵌入(RVSE),其包含称为图像语义保持增强(SPAugI)和文本语义保持增强(SPAugT)的新型基于图像与基于文本的增强技术。由于 SPAugI 和 SPAugT 以保留语义信息的方式改变原始数据,我们强制特征提取器生成语义感知的嵌入向量而不论损坏与否,从而显著提升模型鲁棒性。在使用基准数据集的大量实验中,我们表明 RVSE 在图文检索性能上优于传统检索方案。
引用
@article{arxiv.2303.05692,
title = {Semantic-Preserving Augmentation for Robust Image-Text Retrieval},
author = {Sunwoo Kim and Kyuhong Shim and Luong Trung Nguyen and Byonghyo Shim},
journal= {arXiv preprint arXiv:2303.05692},
year = {2023}
}
备注
Accepted to ICASSP 2023