中文

PaperMind:面向多模态 LLM 的科研论文代理推理与批判性评估基准

信息检索 2026-04-29 v2

摘要

理解科研论文的远不止回答孤立问题或概括内容,而是需要一种综合推理过程,使其在文本与视觉信息之间建立联系,解释实验证据,跨来源综合信息,并批判性地评估科学主张。然而,现有基准测试通常在孤立方式下评估这些能力,难以将科研论文理解作为一套相互交互的认知能力进行整体评估。本文引入 PaperMind,一个旨在评估科研论文中集成化和代理导向推理的基准测试。PaperMind 由真实科研论文构建而成,覆盖七个学科领域,包括农业、生物学、化学、计算机科学、医学、物理学和经济学。其包含四个互补任务家族,整体操作化科研论文推理的不同认知面貌,包括多模态 grounding、实验解释、跨来源证据推理和批判性评估。通过分析模型在多个任务中的行为,PaperMind 实现对集成化科研推理行为的诊断性评估,这类行为难以通过孤立任务评估来考察。对开源和闭源多模态 LLM 的大规模实验揭示了模型在各任务间持续的性能差距,凸显了集成化科研推理与批判性评估面临的持久挑战。我们的基准测试和数据集已公开于 https://github.com/Yanjun-Zhao/PaperMind。

关键词

引用

@article{arxiv.2604.21304,
  title  = {PaperMind: Benchmarking Agentic Reasoning and Critique over Scientific Papers in Multimodal LLMs},
  author = {Yanjun Zhao and Tianxin Wei and Jiaru Zou and Xuying Ning and Yuanchen Bei and Lingjie Chen and Simmi Rana and Wendy H. Yang and Hanghang Tong and Jingrui He},
  journal= {arXiv preprint arXiv:2604.21304},
  year   = {2026}
}