中文

DiMB-RE:从科学文献中挖掘饮食-微生物组关联

计算与语言 2025-04-01 v2

摘要

目的:从生物医学文献中开发一个标注了饮食-微生物组关联的语料库,并训练自然语言处理(NLP)模型来识别这些关联,从而增进对其在健康和疾病中作用的理解,并支持个性化营养策略。材料与方法:我们构建了DiMB-RE,一个全面的语料库,标注了15种实体类型(如营养素、微生物)和13种关系类型(如INCREASES、IMPROVES),以捕捉饮食-微生物组关联。我们使用DiMB-RE对最先进的NLP模型进行了微调和评估,用于命名实体识别、触发词识别、关系抽取以及事实性检测。此外,我们在数据集的子集上,以零样本和单样本设置对两个生成式大语言模型(GPT-4o-mini和GPT-4o)进行了基准测试。结果:DiMB-RE包含来自165篇出版物(包括30个完整的“结果”部分)的14,450个实体和4,206个关系。微调后的NLP模型在命名实体识别上表现良好(F1分数0.800),而端到端的关系抽取性能则较为一般(F1分数0.445)。使用“结果”部分的标注改善了关系抽取。触发词检测的影响好坏参半。生成式模型的准确率低于微调模型。讨论:据我们所知,DiMB-RE是专注于饮食-微生物组相互作用的最大且最多样化的语料库。在DiMB-RE上微调的NLP模型表现出比类似语料库更低的性能,这突显了该领域信息抽取的复杂性。实体分类错误、触发词遗漏和跨句关系是关系抽取错误的主要来源。结论:DiMB-RE可作为生物医学文献挖掘的基准语料库。DiMB-RE和NLP模型可在https://github.com/ScienceNLP-Lab/DiMB-RE获取。

关键词

引用

@article{arxiv.2409.19581,
  title  = {DiMB-RE: Mining the Scientific Literature for Diet-Microbiome Associations},
  author = {Gibong Hong and Veronica Hindle and Nadine M. Veasley and Hannah D. Holscher and Halil Kilicoglu},
  journal= {arXiv preprint arXiv:2409.19581},
  year   = {2025}
}

备注

Accepted for publication in Journal of the American Medical Informatics Association. Please refer to the supplementary data if needed: https://doi.org/10.1093/jamia/ocaf054