MedDistant19:面向广覆盖生物医学关系抽取的准确基准
计算与语言
2022-09-14 v2 机器学习
摘要
生物医学领域的关系抽取因标注数据匮乏与标注成本高(需领域专家)而具挑战性。远程监督通过将知识图谱关系与原始文本自动配对,常用于缓解标注数据稀缺。该流程易引入噪声,且在覆盖大量生物医学概念时扩展困难。我们调研了现有广覆盖远程监督生物医学关系抽取基准,发现训练与测试关系重叠显著,介于26%至86%。此外,我们注意到这些基准数据构建过程中的若干不一致,且在无训练-测试泄漏时,其聚焦于较窄实体类型间的交互。本文提出更准确的广覆盖远程监督生物医学关系抽取基准MedDistant19,解决了上述不足,通过将MEDLINE摘要与广泛使用的SNOMED临床术语知识库对齐获得。鉴于缺乏领域特定语言模型的充分评估,我们也开展实验,将通用领域关系抽取结论验证于生物医学关系抽取。
引用
@article{arxiv.2204.04779,
title = {MedDistant19: Towards an Accurate Benchmark for Broad-Coverage Biomedical Relation Extraction},
author = {Saadullah Amin and Pasquale Minervini and David Chang and Pontus Stenetorp and Günter Neumann},
journal= {arXiv preprint arXiv:2204.04779},
year = {2022}
}
备注
Accepted by COLING 2022 (Oral presentation, Main Conference: Long Papers)