面向生物医学文献的实体驱动事实感知抽取式摘要
计算与语言
2022-03-31 v1 机器学习
摘要
在每年大量发表的科学文章中,生物医学文献的发表速度持续攀升。因此,人们已投入大量努力来利用并总结海量的生物医学研究文章。尽管基于 transformer 的编码器-解码器模型在常规源文档到摘要设定下已在不同领域的抽取式摘要中被广泛研究,其主要局限仍是实体幻觉(即生成摘要包含与源文章无关或未出现的实体)与事实不一致。这一问题在生物医学场景中尤为严重,因为命名实体及其语义(可通过知识库捕获)构成了文章的核心。利用从与命名实体相关的背景知识库中挖掘的命名实体与事实来引导抽取式摘要,在生物医学文章摘要文献中尚未被研究。本文提出一种实体驱动事实感知框架,用于训练端到端基于 transformer 的编码器-解码器模型以生成生物医学文章抽取式摘要。我们将所提方法称为 EFAS(Entity-driven Fact-aware Abstractive Summarization,实体驱动事实感知抽取式摘要),其基础模块为基于 transformer 的模型。我们使用五种最先进的基于 transformer 的模型(其中两种专为长文档摘要设计)进行实验,证明在这些模型的训练/推理阶段注入知识,使其在实体级事实准确性、N-gram 新颖性与语义等价性方面显著优于标准源文档到摘要设定,同时在 ROUGE 指标上表现相当。所提方法在 ICD-11-Summ-1000 与 PubMed-50k 上进行了评估。
引用
@article{arxiv.2203.15959,
title = {Entity-driven Fact-aware Abstractive Summarization of Biomedical Literature},
author = {Amanuel Alambo and Tanvi Banerjee and Krishnaprasad Thirunarayan and Michael Raymer},
journal= {arXiv preprint arXiv:2203.15959},
year = {2022}
}
备注
Accepted to ICPR 2022