结合词嵌入与 N-gram 的无监督文档摘要
计算与语言
2020-04-30 v1 机器学习
机器学习
摘要
基于图的抽取式文档摘要依赖于句子相似度图的质量。基于词袋或 tf-idf 的句子相似度使用精确词匹配,但无法衡量单个词之间的语义相似度,也无法考虑句子的语义结构。为了改进句子间的相似度度量,我们采用现成的深度嵌入特征和 tf-idf 特征,并引入一种新的文本相似度度量。我们构建了一个改进的句子相似度图,并将其用于抽取式摘要的子模目标函数中,该函数由加权覆盖项和多样性项组成。我们开发了一个基于 Transformer 的压缩模型用于句子压缩,以辅助文档摘要。我们的摘要方法是抽取式且无监督的。实验表明,我们的方法可以优于基于 tf-idf 的方法,并在 DUC04 数据集上取得最先进的性能,在 CNN/DM 和 NYT 数据集上取得与全监督学习方法相当的性能。
引用
@article{arxiv.2004.14119,
title = {Combining Word Embeddings and N-grams for Unsupervised Document Summarization},
author = {Zhuolin Jiang and Manaj Srivastava and Sanjay Krishna and David Akodes and Richard Schwartz},
journal= {arXiv preprint arXiv:2004.14119},
year = {2020}
}