MMReview:面向 LLM 评审自动化的多学科多模态基准
计算与语言
2025-10-09 v4
摘要
随着学术论文出版量的快速增长,盲审已成为学术界必不可少却耗时的职责。大型语言模型(LLM)越来越多地被用于辅助生成评审意见;然而,现有的 LLM 评审任务缺乏统一的评估基准,难以严格评估模型在生成全面、准确且符合人类偏好的评估方面的能力,尤其是在涉及图形和表格等多模态内容的场景中。为填补这一空白,我们提出了覆盖多个学科和模态的全面基准测试集 MMReview。MMReview 包含 240 篇论文中涉及图形和表格等多模态内容,以及专家编写的评审意见,这些论文涵盖 17 个研究领域,属于四大学术学科:人工智能、自然科学、工程科学和社会科学。我们设计了 13 项任务,分为四个核心类别,旨在评估 LLM 和多模态 LLM(MLLM)在逐步评审生成、结果形式化、与人类偏好一致性以及对对抗性输入操纵的鲁棒性方面的性能。在 16 个开源模型和 5 个高级闭源模型上进行的大量实验表明了该基准的全面性。我们设想 MMReview 是建立自动化盲审系统标准化基础的关键一步。
引用
@article{arxiv.2508.14146,
title = {MMReview: A Multidisciplinary and Multimodal Benchmark for LLM-Based Peer Review Automation},
author = {Xian Gao and Jiacheng Ruan and Zongyun Zhang and Jingsheng Gao and Ting Liu and Yuzhuo Fu},
journal= {arXiv preprint arXiv:2508.14146},
year = {2025}
}
备注
Work in progress