中文

MM-CRITIC:面向多模态批判的大型多模态模型全面评估

计算与语言 2025-11-13 v1 人工智能

摘要

批判能力是模型自我改进并作为可靠AI助手发挥作用的关键。尽管在语言-only设置中已广泛研究,但大型多模态模型(LMMs)的多模态批判仍在不足之处,尽管其在描述生成和视觉推理等任务中能力日益提升。本文引入MM-CRITIC,一个用于评估LMM批判能力的全面基准测试,覆盖多个维度:基础、纠正和比较。该基准覆盖8种主要任务类型和超过500个任务,收集了来自不同模型规模的LMM的响应,包含4471个样本。为提高评估的可靠性,我们将专家信息化的参考答案整合到评分规范中,以引导GPT-4o对响应进行打分并生成参考批判,这些参考批判作为可信判断的锚点。大量实验表明,MM-CRITIC的有效性得到验证,并对领先LMM的批判能力在多个维度上进行了全面评估。进一步分析揭示了一些关键见解,包括响应质量与批判之间的相关性,以及批判难度在不同评估维度上的差异。我们的代码可用 https://github.com/MichealZeng0420/MM-Critic。

关键词

引用

@article{arxiv.2511.09067,
  title  = {MM-CRITIC: A Holistic Evaluation of Large Multimodal Models as Multimodal Critique},
  author = {Gailun Zeng and Ziyang Luo and Hongzhan Lin and Yuchen Tian and Kaixin Li and Ziyang Gong and Jianxiong Guo and Jing Ma},
  journal= {arXiv preprint arXiv:2511.09067},
  year   = {2025}
}

备注

28 pages, 14 figures, 19 tables