MLLM-as-a-Judge:利用视觉 - 语言基准评估多模态大语言模型即裁判
计算与语言
2024-06-12 v3 人工智能
计算机视觉与模式识别
摘要
多模态大语言模型(Multimodal Large Language Models, MLLMs)最近引起了广泛关注,在通用人工智能方面显示出巨大的潜力。然而,评估 MLLMs 的效用面临相当大的挑战,主要是由于缺乏与人类偏好一致的多模态基准。受大语言模型中“大语言模型即裁判”(LLM-as-a-Judge)概念的启发,本文引入了一种名为 MLLM-as-a-Judge 的新基准,以评估 MLLMs 在不同模态下辅助裁判的能力,涵盖三个不同的任务:评分评估、成对比较和批量排序。我们的研究表明,虽然 MLLMs 在成对比较中表现出显著的人类般辨别力,但在评分评估和批量排序中与人类偏好存在显著分歧。此外,更深入的检查揭示了 LLMs 在判断能力方面存在的持续挑战,包括多种偏见、幻觉响应和判断不一致,即使在 GPT-4V 等先进模型中也是如此。这些发现强调,在将 MLLMs 视为完全可靠的评估者之前,迫切需要对其进行改进并开展进一步的研究工作。鉴于此,我们主张投入更多精力支持 MLLM 作为裁判领域的持续发展。代码和数据集可在我们的项目主页公开获取:\url{https://mllm-judge.github.io/}。
引用
@article{arxiv.2402.04788,
title = {MLLM-as-a-Judge: Assessing Multimodal LLM-as-a-Judge with Vision-Language Benchmark},
author = {Dongping Chen and Ruoxi Chen and Shilin Zhang and Yinuo Liu and Yaochen Wang and Huichi Zhou and Qihui Zhang and Yao Wan and Pan Zhou and Lichao Sun},
journal= {arXiv preprint arXiv:2402.04788},
year = {2024}
}
备注
ICML 2024 (Oral)