中文

大纲生成:理解文档的固有内容结构

计算与语言 2019-05-27 v1

摘要

本文提出并解决了大纲生成(OG)任务,该任务旨在通过识别多段落文档的潜在章节并生成相应的章节标题,来揭示其固有内容结构。在不失一般性的情况下,OG 任务可视为一种新颖的结构化摘要任务。为生成合理的大纲,理想的 OG 模型应能够捕捉三个层次的连贯性,即上下文段落之间的连贯性、章节与其标题之间的连贯性,以及上下文标题之间的连贯性。第一种是章节识别的基础,而后两种对于一致的标题生成至关重要。在本工作中,我们将 OG 任务表述为一个分层结构化预测问题,即先预测章节边界序列,再相应地预测章节标题序列。我们为该任务提出了一种名为 HiStGen 的新型分层结构化神经生成模型。我们的模型试图通过以下方式捕捉三级连贯性。首先,我们在上下文段落之间引入马尔可夫段落依赖机制以进行章节识别。其次,我们采用章节感知注意力机制以确保章节与其标题之间的语义连贯性。最后,我们利用马尔可夫标题依赖机制及上下文标题间的审阅机制,以改善一致性并消除章节标题间的重复。此外,我们构建了新颖的 WIKIOG 数据集,这是一个由超过 175 万对文档-大纲组成的公开集合,用于 OG 任务的研究。在我们的基准数据集上的实验结果表明,我们的模型可显著优于若干最先进的 OG 任务序列生成模型。

关键词

引用

@article{arxiv.1905.10039,
  title  = {Outline Generation: Understanding the Inherent Content Structure of Documents},
  author = {Ruqing Zhang and Jiafeng Guo and Yixing Fan and Yanyan Lan and Xueqi Cheng},
  journal= {arXiv preprint arXiv:1905.10039},
  year   = {2019}
}

备注

10 pages, Long paper accepted by SIGIR 2019