增强生物医学关系抽取的方向性
计算与语言
2025-01-27 v1
摘要
生物关系网络包含丰富信息,有助于理解实体(如基因、蛋白质、疾病和化学物质)之间关系背后的生物机制。巨大的生物医学文献规模给更新网络知识带来显著挑战。最近提供的生物医学关系抽取数据集(BioRED)提供了宝贵的手动标注,促进了基于机器学习和预训练语言模型的方法开发,以自动识别新型文档级(跨句子上下文)关系。然而,其标注缺乏实体角色(主体/客体)的方向性,这对于研究复杂生物网络至关重要。本文对 BioRED 语料库中的实体角色进行标注,并提出一种新型多任务语言模型结合软提示学习,联合识别关系、新发现和实体角色。我们的结果包括一个包含 10,864 条方向性标注的丰富 BioRED 语料库。此外,我们提出的方法在两个基准任务上超越了最先进的 GPT-4 和 Llama-3 等大型语言模型。我们的源代码和数据集已公开于 https://github.com/ncbi-nlp/BioREDirect。
引用
@article{arxiv.2501.14079,
title = {Enhancing Biomedical Relation Extraction with Directionality},
author = {Po-Ting Lai and Chih-Hsuan Wei and Shubo Tian and Robert Leaman and Zhiyong Lu},
journal= {arXiv preprint arXiv:2501.14079},
year = {2025}
}