中文

Judge Anything:跨模态评估任意生成式模型

计算与语言 2025-03-25 v1 计算机视觉与模式识别

摘要

在多样化模态(如图像、音频、视频)上,对生成式基础模型进行开放式多模态理解(MMU)和生成(MMG)任务的评估,由于跨模态交互的复杂性,面临着显著挑战。为此,一种利用多模态LLM(MLLM)作为自动评判员的想法涌现出来,在评估视觉语言理解任务方面取得鼎舞成果。进一步推进,本文通过引入两个基准测试(TaskAnything和JudgeAnything),以统一方式将MLLM-as-a-Judge扩展到任意模态。具体而言,TaskAnything评估了15种any-to-any模态类别的MMU和MMG能力,采用来自众所周知基准测试的1500个查询。此外,JudgeAnything从Pair Comparison和Score Evaluation两个角度评估了5个先进模型(如GPT-4o和Gemini-2.0-Flash)的评判能力,提供了一个标准化测试平台,融合人类判断和详细评分标准。我们的广泛实验显示,尽管这些MLLM在评估MMU方面表现有前景(在Pair Comparisonsetting下平均达到66.55%,在Score Evaluationsetting下达到42.79%),但在MMG任务中遇到了显著挑战(在Pair Comparisonsetting下仅平均53.37%,在Score Evaluationsetting下仅30.05%),暴露出跨模态偏见和幻觉问题。为此,我们提出OmniArena,一个用于评估全模态模型和多模态奖励模型的自动化平台。我们的工作凸显了需要更公平的评估协议以及更强与人类偏好的对齐的重要性。源代码和数据集已公开于:https://urrealhero.github.io/judgeanythingweb/。

关键词

引用

@article{arxiv.2503.17489,
  title  = {Judge Anything: MLLM as a Judge Across Any Modality},
  author = {Shu Pu and Yaochen Wang and Dongping Chen and Yuhang Chen and Guohao Wang and Qi Qin and Zhongyi Zhang and Zhiyuan Zhang and Zetong Zhou and Shuang Gong and Yi Gui and Yao Wan and Philip S. Yu},
  journal= {arXiv preprint arXiv:2503.17489},
  year   = {2025}
}