中文

PaSa:一个用于全面学术论文检索的 LLM 智能体

信息检索 2025-05-28 v2 机器学习

摘要

我们介绍 PaSa,这是一个由大型语言模型驱动的先进论文搜索智能体。PaSa 可以自主做出一系列决策,包括调用搜索工具、阅读论文和选择相关参考文献,以最终为复杂学者查询获取全面且准确的结果。我们通过包含 35k 条细粒度学术查询及其对应论文(来源于顶级 AI 会议出版物)的合成数据集 AutoScholarQuery 来优化 PaSa。此外,我们开发了 RealScholarQuery,收集真实世界学术查询的基准,用于更真实地评估 PaSa 的性能。尽管基于合成数据训练,PaSa 在 RealScholarQuery 上显著优于现有基线,包括 Google、Google Scholar、Google 配合 GPT-4o 进行改写查询、ChatGPT(启用搜索的 GPT-4o)、GPT-o1 和 PaSa-GPT-4o(由 GPT-4o 实现的 PaSa)。值得注意的是,PaSa-7B 在 recall@20 上超过最佳 Google 基线 Google+GPT-4o 提升了 37.78%,在 recall@50 上提升了 39.90%,且在 recall 和 precision 上分别超过 PaSa-GPT-4o 30.36% 和 4.25%。模型、数据集和代码均可在 https://github.com/bytedance/pasa 获取。

关键词

引用

@article{arxiv.2501.10120,
  title  = {PaSa: An LLM Agent for Comprehensive Academic Paper Search},
  author = {Yichen He and Guanhua Huang and Peiyuan Feng and Yuan Lin and Yuchen Zhang and Hang Li and Weinan E},
  journal= {arXiv preprint arXiv:2501.10120},
  year   = {2025}
}