自动生成视觉语言模型评估的有挑战性的多选题
计算机视觉与模式识别
2025-04-10 v2 人工智能
计算与语言
计算机与社会
机器学习
摘要
视觉语言模型 (VLM) 的快速发展需要严格可靠的评估。然而,当前的视觉问答 (VQA) 基准测试往往依赖于开放式问题,由于自然语言答案的变异性,难以进行准确评估。为此,我们引入 AutoConverter,一个智能体框架,可自动将这些开放式问题转换为多选格式,从而实现客观评估,同时减少繁重的多选题创建过程。我们的实验表明,AutoConverter 能够生成正确且具有挑战性的多选题,VLM 在这些问题上的准确率与人类创建的相似或更低。使用 AutoConverter,我们构建了 VMCBench—a 将 20 个现有 VQA 数据集转换为统一多选格式后得到的基准测试,总计 9,018 个问题。我们全面评估了 33 个最先进的 VLM 在 VMCBench 上的表现,制定了可扩展、一致且可复现的 VLM 评估新标准。
引用
@article{arxiv.2501.03225,
title = {Automated Generation of Challenging Multiple-Choice Questions for Vision Language Model Evaluation},
author = {Yuhui Zhang and Yuchang Su and Yiming Liu and Xiaohan Wang and James Burgess and Elaine Sui and Chenyu Wang and Josiah Aklilu and Alejandro Lozano and Anjiang Wei and Ludwig Schmidt and Serena Yeung-Levy},
journal= {arXiv preprint arXiv:2501.03225},
year = {2025}
}
备注
CVPR 2025