中文

PaperAsk:用于 LLM 在论文检索与阅读中可靠性评估的基准测试

信息检索 2025-10-28 v1 人工智能 计算与语言

摘要

大型语言模型(LLM)越来越多地作为研究助手,但其在学术任务中的可靠性仍未得到充分评估。本文引入 PaperAsk,一个系统性评估 LLM 在四个关键研究任务中的表现:引用检索、内容抽取、文献发现和主张验证。我们在真实使用场景下(通过网页界面,检索操作对用户而言是不可见的)评估 GPT-4o、GPT-5 和 Gemini-2.5-Flash。通过控制实验发现,一致的可靠性失效:在多参考查询中,引用检索失败率为 48%-98%;在 72%-91% 的案例中,章节特定内容抽取失败;主题文献发现的 F1 分数低于 0.32,遗漏超过 60% 的相关文献。进一步的人类分析将这些失效归因于检索上下文的不可控扩张,以及 LLM 倾向于优先考虑语义相关文本而非任务指令。对于基础任务,LLM 显示出不同的失效行为:ChatGPT 常因防御性保留响应以避免错误,Gemini 则生成流畅但虚构的答案。为此,我们开发了基于 PaperAsk 数据训练的轻量级可靠性分类器,用于识别不可靠输出。PaperAsk 提供了一个可复现且可诊断的框架,推动 LLM 基于学术辅助系统的可靠性评估。

关键词

引用

@article{arxiv.2510.22242,
  title  = {PaperAsk: A Benchmark for Reliability Evaluation of LLMs in Paper Search and Reading},
  author = {Yutao Wu and Xiao Liu and Yunhao Feng and Jiale Ding and Xingjun Ma},
  journal= {arXiv preprint arXiv:2510.22242},
  year   = {2025}
}