通过不确定性理解神经抽象摘要模型
计算与语言
2020-10-16 v1
摘要
seq2seq 抽象摘要模型的一个优势是以自由形式生成文本,但这种灵活性使得解释模型行为变得困难。在这项工作中,我们通过研究模型词元级预测的熵(即不确定性),以黑盒和白盒两种方式分析摘要解码器。对于两个强大的预训练模型 PEGASUS 和 BART 在两个摘要数据集上的表现,我们发现低预测熵与模型复制词元而非生成新文本的位置之间存在强相关性。解码器的不确定性还与句子位置和相邻词元对之间的句法距离等因素相关,从而让人了解哪些因素使上下文对模型下一个输出词元具有特别的选择性。最后,我们研究了解码器不确定性与注意力行为之间的关系,以理解注意力如何产生模型中这些观察到的效应。我们表明,不确定性是分析摘要及更广泛的文本生成模型的一个有用视角。
引用
@article{arxiv.2010.07882,
title = {Understanding Neural Abstractive Summarization Models via Uncertainty},
author = {Jiacheng Xu and Shrey Desai and Greg Durrett},
journal= {arXiv preprint arXiv:2010.07882},
year = {2020}
}
备注
To appear in EMNLP 2020; code available at https://github.com/jiacheng-xu/text-sum-uncertainty