中文

基于查询的文件级生物医学研究证据抽取

计算与语言 2025-06-02 v3 人工智能

摘要

从生物医学研究中抽取生物医学证据(例如:干细胞移植是否改善来自不可耐受克罗恩病患者的生活质量,与安慰剂相比?)是综合生物医学证据的关键步骤。本文聚焦于从具有相互矛盾证据的临床问题中进行文档级科学证据抽取任务。为支持该任务,我们构建了一个称为 CochraneForest 的数据集,利用 Cochrane 系统综述中的森林图。该数据集包含 202 个标注的森林图、相关临床研究问题、原始文本的完整文本以及研究特定的结论。基于 CochraneForest,我们提出了 URCA(Uniform Retrieval Clustered Augmentation),一个检索增强生成框架,旨�解决证据抽取的独特挑战。我们的实验表明,URCA 在该任务上比最佳现有方法在 F1 分数上提升最高可达 10.3%。然而,结果也凸显了 CochraneForest 的复杂性,使其成为推动自动化证据综合系统发展的具有挑战性的基准。

关键词

引用

@article{arxiv.2505.06186,
  title  = {Query-driven Document-level Scientific Evidence Extraction from Biomedical Studies},
  author = {Massimiliano Pronesti and Joao Bettencourt-Silva and Paul Flanagan and Alessandra Pascale and Oisin Redmond and Anya Belz and Yufang Hou},
  journal= {arXiv preprint arXiv:2505.06186},
  year   = {2025}
}

备注

Accepted at ACL 2025 Main Conference