中文

RELATE:利用 LLM 与本体约束进行生物医学摘要中的关系抽取

信息检索 2025-12-01 v2

摘要

生物医学知识图谱(KG)对于药物发现和临床决策支持至关重要,但目前仍不完整。大型语言模型(LLM)擅长抽取生物医学关系,但其输出缺乏标准化以及与本体的对齐,限制了 KG 的整合。我们引入了 RELATE,一个三阶段流水线,使用 ChemProt 和 Biolink Model 将 LLM 抽取的关系映射到标准化的本体谓词。该流水线包括:(1)带有谓词嵌入的本体预处理,(2)使用 SapBERT 增强的基于相似度的检索,以及(3)带有显式否定处理的基于 LLM 的重排序。该方法将关系抽取从自由文本输出转化为结构化的、受本体约束的表示。在 ChemProt 基准上,RELATE 实现了 52% 的精确匹配和 94% 的 accuracy@10;在 2,400 篇 HEAL Project 摘要中,它有效地拒绝了不相关的关联(0.4%)并识别了否定断言。RELATE 捕获了细微的生物医学关系,同时确保了 KG 增强的质量。通过将向量搜索与上下文 LLM 推理相结合,RELATE 为将非结构化生物医学文献转化为标准化 KG 提供了一个可扩展、语义准确的框架。

关键词

引用

@article{arxiv.2509.19057,
  title  = {RELATE: Relation Extraction in Biomedical Abstracts with LLMs and Ontology Constraints},
  author = {Olawumi Olasunkanmi and Mathew Satusky and Hong Yi and Chris Bizon and Harlin Lee and Stanley Ahalt},
  journal= {arXiv preprint arXiv:2509.19057},
  year   = {2025}
}