中文

不是搜索,而是扫描:面向扫描式学术论文推理的多模态大语言模型基准测试

人工智能 2026-03-31 v1

摘要

随着多模态大语言模型(MLLM)的快速进展,AI 已在文献检索和某些推理任务上表现出色,能够胜任研究人员的助手角色,但距离自主研究仍相去甚远。其根本原因在于,当前关于学术论文推理的工作大多局限于以预指定目标为中心的搜索范式,推理基于相关性检索,难以支持研究者式的全文理解、推理和验证。为弥合这一差距,我们提出了 ScholScan——一个用于学术论文推理的新基准。ScholScan 引入了一种扫描式任务设定,要求模型像人类研究者一样阅读和交叉检查整篇论文,扫描文档以识别一致性问题。该基准包含来自 13 个自然科学领域 715 篇论文的 1,800 个精心标注的问题,涵盖九个错误类别,并提供证据定位和推理轨迹的详细标注,以及统一的评估协议。我们评估了 15 个模型在 24 种输入配置下的表现,并对所有错误类别的 MLLM 能力进行了细粒度分析。总体而言,检索增强生成(RAG)方法未带来显著提升,揭示了当前 MLLM 在扫描式任务上的系统性缺陷,凸显了 ScholScan 所提出的挑战。我们期望 ScholScan 成为扫描式任务范式的领先和代表性工作。

关键词

引用

@article{arxiv.2603.28651,
  title  = {Not Search, But Scan: Benchmarking MLLMs on Scan-Oriented Academic Paper Reasoning},
  author = {Rongjin Li and Zichen Tang and Xianghe Wang and Xinyi Hu and Zhengyu Wang and Zhengyu Lu and Yiling Huang and Jiayuan Chen and Weisheng Tan and Jiacheng Liu and Zhongjun Yang and Haihong E},
  journal= {arXiv preprint arXiv:2603.28651},
  year   = {2026}
}

备注

Accepted to ICLR 2026