逆向图像检索提示参数化记忆于多模态大语言模型中
计算与语言
2024-05-30 v1
摘要
尽管近期多模态大语言模型(MLLMs)取得了显著进展,但像GPT-4系列这样的SOTA模型在知识密集型任务上仍存在挑战。为此,我们考虑逆向图像检索(RIR)增强生成,这是一种简单而有效的策略,通过web规模的逆向图像搜索结果来增强MLLMs。RIR通过开放式VQA评估指标,将GPT-4V的知识密集型视觉问答性能提升37-43%,GPT-4 Turbo提升25-27%,GPT-4o提升18-20%。出人意料的是,我们发现RIR帮助模型更好地访问自身的世界知识。具体而言,我们的实验表明,RIR增强通过提供进一步的视觉和文本线索来实现,而不一定包含查询的直接答案。此外,我们阐明了RIR可能造成性能下降的情况并进行了人类评估。最后,我们发现,采用RIR的总体优势使得能够选择是否使用RIR的智能体难以超过采用RIR为默认设置的方案。
引用
@article{arxiv.2405.18740,
title = {Reverse Image Retrieval Cues Parametric Memory in Multimodal LLMs},
author = {Jialiang Xu and Michael Moor and Jure Leskovec},
journal= {arXiv preprint arXiv:2405.18740},
year = {2024}
}