语言智能体实现科学知识的超人类综合
计算与语言
2024-09-27 v2 人工智能
信息检索
物理与社会
摘要
语言模型因会产生错误信息而众所周知,是否足够准确可靠以致用于科学研究尚不明确。我们开发了一种严格的人类-人工智能比较方法,用于评估语言模型智能体在真实世界文献搜索任务中的表现,涵盖信息检索、摘要生成和矛盾检测任务。我们展示了PaperQA2——一个为提高事实性而优化的前沿语言模型智能体——在三个现实文献研究任务中达到或超过专业人员的性能,且无需对人类施加任何限制(即完全访问互联网、搜索工具和时间)。PaperQA2撰写的引用性、类似维基百科的科学主题摘要显著比现有的、由人类撰写的维基百科文章更准确。我们还引入了一个针对科学文献研究的硬性基准——LitQA2——指导PaperQA2的设计,使其超越了人类水平。最后,我们将PaperQA2应用于识别科学文献中的矛盾,这一重要科学任务对人类而言具有挑战性。PaperQA2在随机抽取的生物学论文子集中每篇论文识别出2.34 +/- 1.99个矛盾,其中70%被人类专家验证。这些结果表明,语言模型智能体现在能够在科学文献的有意义任务上超越领域专家。
引用
@article{arxiv.2409.13740,
title = {Language agents achieve superhuman synthesis of scientific knowledge},
author = {Michael D. Skarlinski and Sam Cox and Jon M. Laurent and James D. Braza and Michaela Hinks and Michael J. Hammerling and Manvitha Ponnapati and Samuel G. Rodriques and Andrew D. White},
journal= {arXiv preprint arXiv:2409.13740},
year = {2024}
}