中文

MM-JudgeBias:评估 MLLM-as-a-Judge 中组合偏差的基准

计算与语言 2026-04-24 v3 人工智能 计算机视觉与模式识别

摘要

多模态大型语言模型 (MLLM) 正在日益被用作自动评估器,形成 MLLM-as-a-Judge 范式。然而,其可靠性及其对偏差的脆弱性仍未得到充分探讨。我们发现许多 MLLM 评估器未能可靠地整合关键视觉或文本线索,在证据缺失或不匹配时产生不可靠的评估,并在语义无关扰动下表现出不稳定性。为此,我们系统性地定义了 MLLM-as-a-Judge 系统中的组合偏差 (Compositional Bias),并引入 MM-JudgeBias 用于评估其表现。MM-JudgeBias 在查询 (Query)、图像 (Image) 和响应 (Response) 三个维度引入受控扰动,通过两种互补指标评估模型行为:偏差偏离度 (Bias-Deviation, BD) 用于衡量灵敏度,偏差一致性 (Bias-Conformity, BC) 用于衡量稳定性。我们构建了超过 1800 个来自 29 个源基准的精选多模态样本数据集,使我们能够对九类偏差在多样任务和领域中的系统表现进行细粒度诊断。对 26 个最先进 MLLM 的实验揭示了系统性的模态忽视和非对称评估倾向,凸显了构建更可靠评估器的必要性。

关键词

引用

@article{arxiv.2604.18164,
  title  = {MM-JudgeBias: A Benchmark for Evaluating Compositional Biases in MLLM-as-a-Judge},
  author = {Sua Lee and Sanghee Park and Jinbae Im},
  journal= {arXiv preprint arXiv:2604.18164},
  year   = {2026}
}

备注

ACL 2026 Main