EvidenceBench:从生物医学论文中提取证据的基准
计算与语言
2025-08-11 v2
摘要
我们研究了自动从生物医学论文中查找与假设相关证据的任务。寻找相关证据是研究人员调查科学假设时的重要步骤。我们引入EvidenceBench来衡量模型在该任务上的性能,该基准由一种新型管道创建,包括假设生成和对生物医学论文进行逐句注释以识别相关证据,完全遵循现有人类专家判断。我们通过多组人类专家注释展示了该管道的有效性和准确性。我们对基准上评估了多样化的语言模型和检索系统,发现模型性能仍显著低于专家水平。为显示所提出管道的可扩展性,我们创建了更大的EvidenceBench-100k,包含107,461篇完整标注的论文,附带假设,以促进模型训练和开发。两个数据集均可在https://github.com/EvidenceBench/EvidenceBench 获取。
引用
@article{arxiv.2504.18736,
title = {EvidenceBench: A Benchmark for Extracting Evidence from Biomedical Papers},
author = {Jianyou Wang and Weili Cao and Kaicheng Wang and Xiaoyue Wang and Ashish Dalvi and Gino Prasad and Qishan Liang and Hsuan-lin Her and Ming Wang and Qin Yang and Gene W. Yeo and David E. Neal and Maxim Khan and Christopher D. Rosin and Ramamohan Paturi and Leon Bergen},
journal= {arXiv preprint arXiv:2504.18736},
year = {2025}
}
备注
Published at Conference on Language Modeling (COLM) 2025