通过闭卷训练提升摘要编码器记忆能力
计算与语言
2018-09-13 v1 人工智能
摘要
一个好的神经序列到序列摘要模型应当拥有一个强大的编码器,能够从长输入文本中提炼并记忆重要信息,从而使解码器能够基于编码器的记忆生成 salient 摘要。本文旨在通过添加一个无注意力和指针机制的额外“闭卷”解码器,来提升指针生成器模型编码器的记忆能力。这样的解码器迫使编码器对其记忆状态中编码的信息更具选择性,因为解码器无法依赖注意力和可能的拷贝模块所提供的额外信息,从而改进了整个模型。在 CNN/Daily Mail 数据集上,我们的双解码器模型在 ROUGE 和 METEOR 指标上显著优于基线,无论是在交叉熵还是强化学习设定下(以及人工评估中)。此外,我们的模型在仅测试的 DUC-2002 泛化性设定中也取得了更高分数。我们进一步提出了一种记忆能力测试、两个显著性度量,以及若干健全性检验消融实验(基于固定编码器、梯度流截断和模型容量),以证明我们的双解码器模型的编码器确实比基线编码器学习到了更强的记忆表征。
引用
@article{arxiv.1809.04585,
title = {Closed-Book Training to Improve Summarization Encoder Memory},
author = {Yichen Jiang and Mohit Bansal},
journal= {arXiv preprint arXiv:1809.04585},
year = {2018}
}
备注
EMNLP 2018 (16 pages)