UPME:一种用于多模态大语言模型评估的无监督同行评审框架
计算机视觉与模式识别
2025-03-20 v1
摘要
多模态大语言模型(MLLMs)涌现出来,旨在解决视觉问答(Visual Question Answering, VQA)中的挑战,催生了新的研究焦点,即对这些模型进行客观评估。现有的评估方法因设计用于视觉图像的Q&A对所需的大量人工工作而受到限制,这本质上限制了评估的规模和范围。虽然尝试通过自动化的MLLMs作为评判官的方法来减少人工工作,但常常会引入偏见。为此,我们提出了一种无监督同行评审评估框架(Unsupervised Peer Review MLLM Evaluation, UPME)。它仅利用图像数据,允许模型自动生成问题并对其他模型的答案进行同行评审评估,从而有效减轻对人工工作的依赖。此外,我们引入了视觉语言评分系统以缓解偏见问题,该系统关注三个方面:(i)响应正确性;(ii)视觉理解与推理;(iii)图像-文本相关性。实验结果表明,UPME在MMstar数据集上与人类评估之间的皮尔逊相关系数为0.944,在ScienceQA数据集上为0.814,表明我们的框架与人类设计的基准以及固有的偏好高度吻合。
引用
@article{arxiv.2503.14941,
title = {UPME: An Unsupervised Peer Review Framework for Multimodal Large Language Model Evaluation},
author = {Qihui Zhang and Munan Ning and Zheyuan Liu and Yanbo Wang and Jiayi Ye and Yue Huang and Shuo Yang and Xiao Chen and Yibing Song and Li Yuan},
journal= {arXiv preprint arXiv:2503.14941},
year = {2025}
}
备注
Accepted by CVPR 2025