中文

基于加噪与去噪的无监督观点摘要

计算与语言 2020-04-22 v1

摘要

在包含数十万文档-摘要对的大规模数据集上监督训练高容量模型,是近期抽象式摘要深度学习技术取得成功的关键。遗憾的是,在多数领域(新闻以外)此类训练数据并不可用且难以获取。本文使监督学习可用于仅有文档(如产品评论或商业评论)而无真实摘要的场景。我们从用户评论语料中采样一条评论,将其假定为摘要,并生成其带噪版本作为伪评论输入,从而构建合成数据集。我们引入若干受语言学驱动的噪声生成函数,以及一个学习对输入去噪并生成原始评论的摘要模型。在测试时,模型接收真实评论并生成包含显著观点的摘要,将未达成共识者视为噪声。大量自动与人工评估表明,我们的模型相较抽象式与抽取式基线均带来实质性改进。

关键词

引用

@article{arxiv.2004.10150,
  title  = {Unsupervised Opinion Summarization with Noising and Denoising},
  author = {Reinald Kim Amplayo and Mirella Lapata},
  journal= {arXiv preprint arXiv:2004.10150},
  year   = {2020}
}

备注

ACL 2020