论文重思:稀疏词汇表征在多模态大语言模型时代的图像检索
计算机视觉与模式识别
2024-08-30 v1 信息检索
摘要
本文重新思考稀疏词汇表征在图像检索中的应用。通过利用支持视觉提示的多模态大语言模型(M-LLMs),我们可以提取图像特征并将其转换为文本数据,从而能够在图像检索任务中利用自然语言处理中使用的高效稀疏检索算法。为帮助大语言模型提取图像特征,我们应用数据增强技术进行关键词扩展,并通过衡量图像与文本数据相关性的指标进行分析。我们实证表明,在基于关键词的图像检索场景中(即关键词作为搜索查询),我们的方法在 MS-COCO、PASCAL VOC 和 NUS-WIDE 数据集上的精确率和召回率性能优于传统视觉语言模型方法。我们还展示了通过迭代地将关键词纳入搜索查询,可以提高检索性能。
引用
@article{arxiv.2408.16296,
title = {Rethinking Sparse Lexical Representations for Image Retrieval in the Age of Rising Multi-Modal Large Language Models},
author = {Kengo Nakata and Daisuke Miyashita and Youyang Ng and Yasuto Hoshi and Jun Deguchi},
journal= {arXiv preprint arXiv:2408.16296},
year = {2024}
}
备注
Accepted to ECCV 2024 Workshops: 2nd Workshop on Traditional Computer Vision in the Age of Deep Learning (TradiCV)