中文

从全文文献构建证据驱动知识库用于疾病特定生物医学推理

计算工程、金融与科学 2026-04-15 v3 人工智能

摘要

生物医学知识资源要么保留为非结构化文本,要么压缩为不包含研究设计、来源及定量支持的平面三元组。本文提出EvidenceNet——一个疾病特定数据集,包含来自全文生物医学文献的逐条证据集合及其对应的图形表示。EvidenceNet采用大型语言模型(LLM)辅助的管道从实验中提取依据为结构化证据记录、规范化生物医学实体、评估证据质量,并通过类型化语义关系连接相关记录。我们发布了EvidenceNet-HCC,包含7,872条证据记录及其对应的图(10,328个节点、49,756条边);以及EvidenceNet-CRC,包含6,622条记录及其对应的图(8,795个节点、39,361条边)。技术验证显示高组件忠诚度,包括98.3%的字段级提取准确率、100.0%的高置信度实体链接准确率、87.5%的融合完整性和90.0%的语义关系类型准确率。下游分析表明,该数据支持检索增强问答和基于图的任务,如未来链接预测和靶点优先级排序。这些结果将EvidenceNet确立为疾病特定生物医学知识库数据集,适用于证据感知分析与复用。

关键词

引用

@article{arxiv.2603.28325,
  title  = {Building evidence-based knowledge bases from full-text literature for disease-specific biomedical reasoning},
  author = {Chang Zong and Sicheng Lv and Si-tu Xue and Huilin Zheng and Jian Wan and Lei Zhang},
  journal= {arXiv preprint arXiv:2603.28325},
  year   = {2026}
}

备注

30 pages, 5 figures, 12 tables