BioREx:利用异构数据集改进生物医学关系抽取
计算与语言
2023-06-21 v1
摘要
生物医学关系抽取(RE)是从自由文本中自动识别并刻画生物医学概念之间关系的任务。RE 是生物医学自然语言处理(NLP)研究中的核心任务,并在许多下游应用中起关键作用,如基于文献的发现与知识图谱构建。现有最优方法主要用于在单个 RE 数据集(如蛋白质-蛋白质相互作用与化学诱导疾病关系)上训练机器学习模型。然而,人工数据集标注由于需要领域知识而极其昂贵且耗时。现有 RE 数据集通常领域特定或规模较小,这限制了通用且高性能 RE 模型的发展。在本文中,我们提出一个新颖框架,用于系统性地处理单个数据集的数据异构性并将其组合为一个大型数据集。基于该框架与数据集,我们报告了 BioREx,一种以数据为中心的关系抽取方法。我们的评估显示 BioREx 比在单个数据集上训练的基准系统性能显著更高,在近期发布的 BioRED 语料上以 F-1 度量从 74.4% 提升至 79.6% 创下新的 SOTA。我们进一步证明该组合数据集可改善五种不同的 RE 任务性能。此外,我们展示平均而言 BioREx 优于当前最优方法如迁移学习与多任务学习。最后,我们在训练数据中未出现的两个独立 RE 任务——药物-药物 N 元组合与文档级基因-疾病 RE——上展示了 BioREx 的鲁棒性与泛化能力。该集成数据集与优化方法已打包为独立工具,可在 https://github.com/ncbi/BioREx 获取。
引用
@article{arxiv.2306.11189,
title = {BioREx: Improving Biomedical Relation Extraction by Leveraging Heterogeneous Datasets},
author = {Po-Ting Lai and Chih-Hsuan Wei and Ling Luo and Qingyu Chen and Zhiyong Lu},
journal= {arXiv preprint arXiv:2306.11189},
year = {2023}
}