面向视觉-语言检索增强生成的多语言基准数据集 VLR-Bench
计算机视觉与模式识别
2024-12-16 v1 人工智能
计算与语言
摘要
我们提出 VLR-Bench,一个用于评估基于检索增强生成 (RAG) 的视觉语言模型 (VLM) 的视觉问答 (VQA) 基准测试。与现有针对外部知识型 VQA 的评估数据集不同,VLR-Bench 包含五个输入段落,这使得能够测试模型确定哪些段落对回答给定查询最有帮助的能力——这是以往研究中缺乏的能力。在此背景下,我们构建了一个包含 32,000 个自动生成指令遵循示例的数据集,称为 VLR-IF。该数据集专为增强 VLM 的 RAG 能力而设计,使其能够根据输入段落生成恰当的答案。我们评估了所提出基准测试和训练数据的有效性,并使用基于 Llama3 的最新 VLM——Llava-Llama-3 模型验证了其性能。所提出的 VLR-Bench 和 VLR-IF 数据集已公开提供。
引用
@article{arxiv.2412.10151,
title = {VLR-Bench: Multilingual Benchmark Dataset for Vision-Language Retrieval Augmented Generation},
author = {Hyeonseok Lim and Dongjae Shin and Seohyun Song and Inho Won and Minjun Kim and Junghun Yuk and Haneol Jang and KyungTae Lim},
journal= {arXiv preprint arXiv:2412.10151},
year = {2024}
}
备注
The 31st International Conference on Computational Linguistics (COLING 2025), 19 pages