ELAIPBench:用于专家级人工智能论文理解的数据集
人工智能
2026-01-08 v2
摘要
虽然大型语言模型(LLM)在众多领域任务中表现出色,但其对完整学术论文的深度理解与推理能力仍未得到充分探索。现有基准往往难以捕捉此类深度,或因表层问题设计或不可靠的评估指标而不足。为填补这一空白,我们提出ELAIPBench——一个由领域专家精选、用于评估人工智能(AI)研究论文理解深度的数据集。经过激励驱动的对抗式标注过程,ELAIPBench包含来自137篇论文的403个多选题,覆盖三个难度等级,强调非平凡推理而非浅层检索。我们的实验表明,最佳表现的LLM仅达到39.95%的准确率,远低于人类水平。此外,我们观察到即便采用思考模式或检索增强生成(RAG)系统的前沿LLM,也未能提升最终结果,甚至因过度思考或噪声检索而降低准确率。这进一步凸显了当前LLM能力与真正学术论文理解之间存在的显著差距。
关键词
引用
@article{arxiv.2510.10549,
title = {ELAIPBench: A Benchmark for Expert-Level Artificial Intelligence Paper Understanding},
author = {Xinbang Dai and Huikang Hu and Yongrui Chen and Jiaqi Li and Rihui Jin and Yuyang Zhang and Xiaoguang Li and Lifeng Shang and Guilin Qi},
journal= {arXiv preprint arXiv:2510.10549},
year = {2026}
}
备注
24 pages, 21 figures