中文

MMReview:面向 LLM 评审自动化的多学科多模态基准

计算与语言 2025-10-09 v4

摘要

随着学术论文出版量的快速增长,盲审已成为学术界必不可少却耗时的职责。大型语言模型(LLM)越来越多地被用于辅助生成评审意见;然而,现有的 LLM 评审任务缺乏统一的评估基准,难以严格评估模型在生成全面、准确且符合人类偏好的评估方面的能力,尤其是在涉及图形和表格等多模态内容的场景中。为填补这一空白,我们提出了覆盖多个学科和模态的全面基准测试集 MMReview。MMReview 包含 240 篇论文中涉及图形和表格等多模态内容,以及专家编写的评审意见,这些论文涵盖 17 个研究领域,属于四大学术学科:人工智能、自然科学、工程科学和社会科学。我们设计了 13 项任务,分为四个核心类别,旨在评估 LLM 和多模态 LLM(MLLM)在逐步评审生成、结果形式化、与人类偏好一致性以及对对抗性输入操纵的鲁棒性方面的性能。在 16 个开源模型和 5 个高级闭源模型上进行的大量实验表明了该基准的全面性。我们设想 MMReview 是建立自动化盲审系统标准化基础的关键一步。

关键词

引用

@article{arxiv.2508.14146,
  title  = {MMReview: A Multidisciplinary and Multimodal Benchmark for LLM-Based Peer Review Automation},
  author = {Xian Gao and Jiacheng Ruan and Zongyun Zhang and Jingsheng Gao and Ting Liu and Yuzhuo Fu},
  journal= {arXiv preprint arXiv:2508.14146},
  year   = {2025}
}

备注

Work in progress