Vibe-Eval:衡量多模态语言模型进展的高难度评测套件
计算与语言
2024-05-06 v1 人工智能
计算机视觉与模式识别
摘要
我们推出了 Vibe-Eval:一个用于评估多模态聊天模型的全新开放基准与框架。Vibe-Eval 包含 269 个视觉理解提示,其中 100 个为高难度提示,并配有由专家撰写的黄金标准回答。Vibe-Eval 是开放式的且具有挑战性,其双重目标为:(i) 对多模态聊天模型进行日常任务的“氛围检查”,以及 (ii) 严格测试和探查当前前沿模型的能力。值得注意的是,我们的高难度集中有超过 50% 的问题,所有前沿模型均回答错误。我们探讨了在极具挑战性的提示上设计、评估和排名模型的细微差别。我们还讨论了人工评估与自动评估之间的权衡,并表明使用 Reka Core 进行的自动模型评估与人类判断大致相关。我们为轻量级评估提供免费 API 访问,并计划对在 Vibe-Eval 自动评分上表现良好的公开模型进行正式的人工评估。我们发布了评估代码和数据,请参阅 https://github.com/reka-ai/reka-vibe-eval
引用
@article{arxiv.2405.02287,
title = {Vibe-Eval: A hard evaluation suite for measuring progress of multimodal language models},
author = {Piotr Padlewski and Max Bain and Matthew Henderson and Zhongkai Zhu and Nishant Relan and Hai Pham and Donovan Ong and Kaloyan Aleksiev and Aitor Ormazabal and Samuel Phua and Ethan Yeo and Eugenie Lamprecht and Qi Liu and Yuqi Wang and Eric Chen and Deyu Fu and Lei Li and Che Zheng and Cyprien de Masson d'Autume and Dani Yogatama and Mikel Artetxe and Yi Tay},
journal= {arXiv preprint arXiv:2405.02287},
year = {2024}
}