PaperSearchQA: 基于RLVR学习科学论文的搜索与推理
机器学习
2026-01-27 v1 人工智能
计算与语言
信息检索
摘要
搜索智能体是能够推理并搜索知识库(或网络)以回答问题的语言模型 (LM);近期方法仅使用带有可验证奖励的强化学习 (RLVR) 来监督最终答案的准确性。大多数 RLVR 搜索智能体处理通用领域的问答 (QA),这限制了它们与科学、工程和医学领域技术 AI 系统的相关性。在本工作中,我们提出训练智能体在科学论文上进行搜索和推理——这测试了技术问答能力,与真实科学家直接相关,并且这些能力对未来 AI 科学家系统至关重要。具体而言,我们发布了一个包含 1600 万篇生物医学论文摘要的搜索语料库,并构建了一个名为 PaperSearchQA 的具有挑战性的事实型问答数据集,其中包含 6 万个可从语料库中找到答案的样本,以及基准测试。我们在该环境中训练搜索智能体,使其性能优于非 RL 检索基线;我们还进行了进一步的定量分析,并观察到了规划、推理和自我验证等有趣的智能体行为。我们的语料库、数据集和基准测试可使用流行的 Search-R1 代码库进行 RLVR 训练,并已在 https://huggingface.co/collections/jmhb/papersearchqa 上发布。最后,我们的数据创建方法具有可扩展性,且易于扩展到其他科学领域。
引用
@article{arxiv.2601.18207,
title = {PaperSearchQA: Learning to Search and Reason over Scientific Papers with RLVR},
author = {James Burgess and Jan N. Hansen and Duo Peng and Yuhui Zhang and Alejandro Lozano and Min Woo Sun and Emma Lundberg and Serena Yeung-Levy},
journal= {arXiv preprint arXiv:2601.18207},
year = {2026}
}
备注
EACL 2026