视觉搜索助手:赋能视觉-语言模型成为多模态搜索引擎
计算机视觉与模式识别
2024-10-29 v1 人工智能
信息检索
机器学习
摘要
搜索引擎能够通过文本检索未知信息。然而,传统方法在理解不熟悉的视觉内容时显得力不从心,例如识别模型从未见过的物体。这一挑战对于大型视觉-语言模型(VLM)尤为突出:如果模型未曾接触过图像中描绘的物体,它就难以对用户关于该图像的问题生成可靠的答案。此外,随着新物体和新事件不断涌现,由于计算负担沉重,频繁更新 VLM 是不切实际的。为了解决这一局限性,我们提出了视觉搜索助手,这是一个促进 VLM 与网络代理协作的新颖框架。该方法利用 VLM 的视觉理解能力和网络代理的实时信息访问能力,通过网络执行开放世界的检索增强生成。通过这种协作整合视觉和文本表示,即使图像对系统来说是新颖的,模型也能提供有根据的响应。在开放集和封闭集问答基准上进行的广泛实验表明,视觉搜索助手显著优于其他模型,并且可以广泛应用于现有的 VLM。
引用
@article{arxiv.2410.21220,
title = {Vision Search Assistant: Empower Vision-Language Models as Multimodal Search Engines},
author = {Zhixin Zhang and Yiyuan Zhang and Xiaohan Ding and Xiangyu Yue},
journal= {arXiv preprint arXiv:2410.21220},
year = {2024}
}
备注
Code is available at https://github.com/cnzzx/VSA