中文

通过硬期望最大化迭代改进生物医学实体链接与事件抽取

计算与语言 2023-05-25 v1

摘要

生物医学实体链接与事件抽取是支撑生物医学领域文本理解与检索的两项关键任务。这两个任务本质上相互受益:实体链接通过参考外部知识库消除生物医学概念的歧义,而领域知识进一步提供额外线索以理解和抽取生物过程;同时,事件抽取识别描述每个生物过程的关键触发词与涉及实体,并捕获结构上下文以更好地消除生物医学实体的歧义。然而,以往研究通常分别或以流水线方式解决这两项任务,导致错误传播。此外,由于现有数据集均无同时包含两项任务的标注,联合解决这两项任务更具挑战。为应对这些挑战,我们提出联合生物医学实体链接与事件抽取,将知识库中的事件结构与实体引用视为潜变量,并以硬期望最大化(EM)方式更新两个任务专用模型:(1)基于当前两个任务专用模型为每个部分标注数据集预测缺失变量;(2)在相应的伪补全数据集上更新各模型参数。在事件抽取基准数据集 Genia 2011 与实体链接基准数据集 BC4GO 上的实验结果表明,我们的联合框架显著改进了各单独任务的模型,并在两项任务上均优于强基线。论文录用后我们将公开代码与模型检查点。

关键词

引用

@article{arxiv.2305.14645,
  title  = {Iteratively Improving Biomedical Entity Linking and Event Extraction via Hard Expectation-Maximization},
  author = {Xiaochu Li and Minqian Liu and Zhiyang Xu and Lifu Huang},
  journal= {arXiv preprint arXiv:2305.14645},
  year   = {2023}
}

备注

15 pages, 3 figures, 10 tables