WildVision: 使用人类偏好在野外评估视觉语言模型
计算机视觉与模式识别
2024-06-18 v1 人工智能
计算与语言
摘要
近期在视觉语言模型(VLMs)方面的突破强调了在真实世界多模态交互中评估人类偏好数据的必要性。为此,我们在线推出了 WildVision-Arena(WV-Arena)平台,收集人类偏好以评估 VLMs。我们通过从 WV-Arena 中的 8000 条用户提交中挑选出 500 条高质量样本,构建了 WV-Bench。WV-Bench 使用 GPT-4 作为裁判器来比较每个 VLM 与 Claude-3-Sonnet,实现了与 WV-Arena Elo 分数的 Spearman 相关系数为 0.94。这显著优于 MMVet、MMMU 和 MMStar 等其他基准。我们对 2 万 条真实世界交互的全面分析揭示了顶尖 VLMs 失败案例的重要见解。例如,我们发现尽管 GPT-4V 在简单视觉识别和推理任务中领先于许多其他模型(如 Reka-Flash、Opus 和 Yi-VL-Plus),但在处理细微情境线索、空间推理、视觉想象和专业领域知识方面仍面临挑战。此外,当前 VLMs 在受到刻意挑衅时也存在幻觉和安全问题。我们正在发布我们的聊天和反馈数据,以进一步推动该领域 VLMs 研究的发展。
引用
@article{arxiv.2406.11069,
title = {WildVision: Evaluating Vision-Language Models in the Wild with Human Preferences},
author = {Yujie Lu and Dongfu Jiang and Wenhu Chen and William Yang Wang and Yejin Choi and Bill Yuchen Lin},
journal= {arXiv preprint arXiv:2406.11069},
year = {2024}
}
备注
link: https://hf.co/spaces/WildVision/vision-arena