Multi-Crit:多准则导向的多模态评判基准测试
计算机视觉与模式识别
2026-03-16 v2
摘要
大型多模态模型 (LMM) 日益被用作多模态评估系统中的评判器,因其在指令遵循方面的强大能力以及与人类偏好的一致性。然而,它们遵循多样化、细粒度评估准则的能力仍未得到充分探索。我们开发了 Multi-Crit,一个用于评估多模态评判器在遵循多准则方面能力及其在准则级别判断中产出可靠结果的基准测试。Multi-Crit 涵盖开放式生成和可验证推理任务,通过严格的数据策展管道构建,该管道收集具有挑战性的响应对并获取多准则人类标注。它进一步引入了三个新指标,系统性地评估多准则遵循性、准则切换灵活性以及准则级别偏好冲突识别能力。对 25 个 LMM 的全面分析揭示:1) 专有模型仍在开放式评估中难以维持对多准则的一致遵循——2) 开源模型在灵活遵循多样化准则方面远落后于此;3) 评判微调虽提升视觉 grounding 能力,却难以在多准则级别判断上取得泛化。此外,对推理微调、测试时扩张以及开源模型与专有模型之间的边界一致性进行了额外分析,进一步探讨了当前多模态评判器的局限性。作为首个研究,Multi-Crit 为构建可靠且可引导的多模态 AI 评估奠定了基础。
引用
@article{arxiv.2511.21662,
title = {Multi-Crit: Benchmarking Multimodal Judges on Pluralistic Criteria-Following},
author = {Tianyi Xiong and Yi Ge and Ming Li and Zuolong Zhang and Pranav Kulkarni and Kaishen Wang and Qi He and Zeying Zhu and Chenxi Liu and Ruibo Chen and Tong Zheng and Yanshuo Chen and Xiyao Wang and Renrui Zhang and Wenhu Chen and Heng Huang},
journal= {arXiv preprint arXiv:2511.21662},
year = {2026}
}
备注
Accepted to CVPR 2026