中文

ImageRef-VL:在视觉语言模型中实现上下文图像引用

计算机视觉与模式识别 2025-01-23 v1 人工智能

摘要

视觉语言模型(VLMs)在理解多模态输入方面展现了卓越的能力,并已广泛集成到基于检索增强生成(RAG)的对话系统中。虽然当前由VLM驱动的聊天机器人可以在其响应中提供文本来源引用,但它们在对话期间引用上下文相关图像方面表现出显著的局限性。在本文中,我们引入了上下文图像引用——即根据对话上下文从检索文档中适当引用相关图像的能力——并系统地研究了VLMs在这方面的能力。我们首次对上下文图像引用进行了评估,包括一个专用的测试数据集和评估指标。此外,我们提出了ImageRef-VL,这是一种通过在大规模、人工整理的多模态对话数据集上进行指令微调,显著增强开源VLMs图像引用能力的方法。实验结果表明,ImageRef-VL不仅优于商用模型,而且在上下文图像引用任务中,其性能比最先进的开源VLMs提升了88%。我们的代码可在https://github.com/bytedance/ImageRef-VL获取。

关键词

引用

@article{arxiv.2501.12418,
  title  = {ImageRef-VL: Enabling Contextual Image Referencing in Vision-Language Models},
  author = {Jingwei Yi and Junhao Yin and Ju Xu and Peng Bao and Yongliang Wang and Wei Fan and Hao Wang},
  journal= {arXiv preprint arXiv:2501.12418},
  year   = {2025}
}