中文

话语感知的神经抽取式文本摘要

计算与语言 2020-04-28 v2

摘要

近来 BERT 已被用于最先进文本摘要模型的文档编码。然而,基于句子的抽取模型常在抽取摘要中产生冗余或信息量低的短语。此外,BERT 是在句子对而非文档上预训练的,故未能很好地捕捉文档中的长距离依赖。为解决这些问题,我们提出一种话语感知的神经摘要模型——DiscoBert。DiscoBert 抽取句子下位的语篇单元(而非句子)作为更细粒度抽取选择的候选。为捕捉语篇单元间的长距离依赖,基于 RST 树与指代提及构建结构话语图,并用图卷积网络编码。实验表明,在流行的摘要基准上,相较其他 BERT-base 模型,所提模型以显著优势超越 SOTA 方法。

关键词

引用

@article{arxiv.1910.14142,
  title  = {Discourse-Aware Neural Extractive Text Summarization},
  author = {Jiacheng Xu and Zhe Gan and Yu Cheng and Jingjing Liu},
  journal= {arXiv preprint arXiv:1910.14142},
  year   = {2020}
}

备注

To appear at ACL 2020; Code available at https://github.com/jiacheng-xu/DiscoBERT