基于多级记忆网络的 Reddit 帖子抽取式摘要
计算与语言
2019-04-10 v2
摘要
我们从两个方向解决抽取式摘要问题:提出一个新数据集与一个新模型。首先,我们收集了 Reddit TIFU 数据集,包含来自在线讨论论坛 Reddit 的 12 万篇帖子。我们使用此类非正式众包生成的帖子作为文本源,与现有大多使用正式文档(如新闻文章)作为源的数据集形成对比。因此,我们的数据集可较少受到某些偏置的影响,即关键句通常位于文本开头,且优选摘要候选已以相似形式存在于文本中。其次,我们提出了一种名为多级记忆网络(MMN)的新颖抽取式摘要模型,配备多级记忆以存储来自不同抽象层次文本的信息。通过量化评估与经由 Amazon Mechanical Turk 的用户研究,我们表明 Reddit TIFU 数据集具有高度抽象性,且 MMN 优于最优摘要模型。
引用
@article{arxiv.1811.00783,
title = {Abstractive Summarization of Reddit Posts with Multi-level Memory Networks},
author = {Byeongchang Kim and Hyunwoo Kim and Gunhee Kim},
journal= {arXiv preprint arXiv:1811.00783},
year = {2019}
}
备注
Published in NAACL-HLT 2019 (Oral)