ImageRef-VL:在视觉语言模型中实现上下文感知图像引用
机器人学
2025-01-23 v1 信号处理
摘要
视觉语言模型(VLM)在理解多模态输入方面展现出惊人的能力,并被广泛集成到基于检索增强生成(RAG)的对话系统中。虽然当前的 VLM 驱动的聊天机器人能够在响应中提供文本来源引用,但在对话过程中对上下文相关图像进行引用方面存在显著局限。本文引入上下文图像引用(Contextual Image Reference)——即根据对话上下文从检索文档中恰当地引用相关图像的能力——并系统性地调查 VLMs 在此方面的能力。我们进行首次针对上下文图像引用的评估,包括专门的测试数据集和评估指标。此外,我们提出 ImageRef-VL 方法,通过在大规模人工精选的多模态对话数据集上进行指令微调,显著提升开源 VLMs 的图像引用能力。实验结果表明,ImageRef-VL 不仅超越了专有模型,还在上下文图像引用任务中相较于最先进的开源 VLMs 实现了 88% 的性能提升。我们的代码已公开于 https://github.com/bytedance/ImageRef-VL。
引用
@article{arxiv.2501.12417,
title = {Egoistic MDS-based Rigid Body Localization},
author = {Niclas Führling and Giuseppe Abreu and David González G. and Osvaldo Gonsa},
journal= {arXiv preprint arXiv:2501.12417},
year = {2025}
}
备注
arXiv admin note: substantial text overlap with arXiv:2501.10219