VisionArena:一个包含 23 万次真实用户与视觉语言模型对话的数据集
计算机视觉与模式识别
2025-03-27 v3
摘要
随着视觉语言模型(VLM)的日益普及和能力增强,我们需要能够捕捉真实用户与 VLM 交互的基准测试。为此,我们创建了 VisionArena,一个包含 23 万次用户与 VLM 之间真实对话的数据集。该数据集收集自 Chatbot Arena——一个用户可与 VLM 交互并提交偏好投票的开源平台,涵盖了 7.3 万名独立用户、45 个 VLM 和 138 种语言。我们的数据集包含三个子集:VisionArena-Chat,包含 20 万次用户与 VLM 之间的单轮和多轮对话;VisionArena-Battle,包含 3 万次比较两个匿名 VLM 并附有用户偏好投票的对话;以及 VisionArena-Bench,一个包含 500 个多样化用户提示的自动基准,可高效地近似实时 Chatbot Arena 的模型排名。此外,我们重点分析了用户提出的问题类型、回答风格对偏好的影响以及模型经常出错的领域。我们发现,像图像描述和幽默生成这样的开放式任务高度依赖风格,而当前的 VLM 在空间推理和规划任务上表现不佳。最后,我们展示了在 VisionArena-Chat 上微调相同的基础模型优于 Llava-Instruct-158K,在 MMMU 上提升了 17 个百分点,在 WildVision 基准上提升了 46 个百分点。数据集可在 https://huggingface.co/lmarena-ai 获取。
关键词
引用
@article{arxiv.2412.08687,
title = {VisionArena: 230K Real World User-VLM Conversations with Preference Labels},
author = {Christopher Chou and Lisa Dunlap and Koki Mashita and Krishna Mandal and Trevor Darrell and Ion Stoica and Joseph E. Gonzalez and Wei-Lin Chiang},
journal= {arXiv preprint arXiv:2412.08687},
year = {2025}
}
备注
updated for CVPR Camera Ready