话语感知的神经抽取式文本摘要
计算与语言
2020-04-28 v2
摘要
近来 BERT 已被用于最先进文本摘要模型的文档编码。然而,基于句子的抽取模型常在抽取摘要中产生冗余或信息量低的短语。此外,BERT 是在句子对而非文档上预训练的,故未能很好地捕捉文档中的长距离依赖。为解决这些问题,我们提出一种话语感知的神经摘要模型——DiscoBert。DiscoBert 抽取句子下位的语篇单元(而非句子)作为更细粒度抽取选择的候选。为捕捉语篇单元间的长距离依赖,基于 RST 树与指代提及构建结构话语图,并用图卷积网络编码。实验表明,在流行的摘要基准上,相较其他 BERT-base 模型,所提模型以显著优势超越 SOTA 方法。
引用
@article{arxiv.1910.14142,
title = {Discourse-Aware Neural Extractive Text Summarization},
author = {Jiacheng Xu and Zhe Gan and Yu Cheng and Jingjing Liu},
journal= {arXiv preprint arXiv:1910.14142},
year = {2020}
}
备注
To appear at ACL 2020; Code available at https://github.com/jiacheng-xu/DiscoBERT