中文

基于自适应文档-关系交叉映射与概念唯一标识符的生物医学关系抽取

计算与语言 2025-01-10 v1 人工智能

摘要

文档级生物医学关系抽取(Bio-RE)旨在从长文本中识别生物医学实体之间的关系,是生物医学文本挖掘的一个重要子领域。现有 Bio-RE 方法难以进行跨句推理,而跨句推理对于捕获跨越多个句子的关系至关重要。此外,以往方法常常忽视文档的不完整性,且缺乏对外部知识的整合,限制了上下文的丰富性。同时,标注数据的稀缺也制约了模型训练。近期大语言模型(LLM)的进展启发我们针对上述问题探索文档级 Bio-RE。具体而言,我们提出了一种基于 LLM 自适应文档-关系交叉映射(ADRCM)微调与概念唯一标识符(CUI)检索增强生成(RAG)的文档级 Bio-RE 框架。首先,我们引入了"关系摘要迭代"(IoRs)提示以解决数据稀缺问题。通过引导 ChatGPT 聚焦于实体关系并迭代优化合成数据,可生成面向 Bio-RE 任务的合成数据。其次,我们提出了 ADRCM 微调,一种在不同文档与关系之间建立映射的新型微调方案,增强了模型的上下文理解与跨句推理能力。最后,在推理阶段,我们设计了名为 CUI RAG 的生物医学专用 RAG 方法,以 CUI 作为实体索引,缩小检索范围并丰富相关文档上下文。在三个 Bio-RE 数据集(GDA、CDR 和 BioRED)上的实验表明,与相关工作相比,我们所提方法达到了最先进性能。

关键词

引用

@article{arxiv.2501.05155,
  title  = {Biomedical Relation Extraction via Adaptive Document-Relation Cross-Mapping and Concept Unique Identifier},
  author = {Yufei Shang and Yanrong Guo and Shijie Hao and Richang Hong},
  journal= {arXiv preprint arXiv:2501.05155},
  year   = {2025}
}

备注

13 pages, 6 figures