利用多样嵌入集改进跨模态检索
计算机视觉与模式识别
2023-07-25 v3
摘要
图像与文本模态间的跨模态检索是一项具有挑战性的任务,因其固有的模糊性:一幅图像常展现多种情境,而一条描述可对应多样图像。基于集合的嵌入已被研究作为该问题的一种解决方案,其旨在将样本编码为一组不同的嵌入向量以捕捉样本的不同语义。本文提出一种新颖的基于集合的嵌入方法,与先前工作在两方面有所不同。首先,我们提出一种称为 smooth-Chamfer 相似度的新相似度函数,旨在缓解现有基于集合嵌入相似度函数的副作用。其次,我们提出一种新颖的集合预测模块,通过 slot attention 机制生成一组有效捕捉输入多样语义的嵌入向量。我们的方法在 COCO 和 Flickr30K 数据集上基于不同视觉骨干网络进行了评估,优于现有方法,包括那些在推理时需要大得多计算量的方法。
引用
@article{arxiv.2211.16761,
title = {Improving Cross-Modal Retrieval with Set of Diverse Embeddings},
author = {Dongwon Kim and Namyup Kim and Suha Kwak},
journal= {arXiv preprint arXiv:2211.16761},
year = {2023}
}
备注
Accepted to CVPR 2023 (Highlight)