中文

抽象摘要中多头注意力的可解释性研究

计算与语言 2019-11-12 v1 机器学习

摘要

深度学习架构中的注意力机制常被用作一种透明化手段,并由此来阐明架构的内部运作。近来,关于这一假设是否正确的兴趣日益增长。本文中,我们研究抽象摘要中多头注意力的可解释性,抽象摘要是一项序列到序列任务,其中注意力并不像机器翻译中那样具有直观的对齐作用。我们首先引入三个度量来深入了解注意力头的关注点,并观察到这些头专门关注相对位置、特定词性标注和命名实体。然而,我们也发现消融和剪枝这些头并不会导致性能显著下降,表明存在冗余。通过将 softmax 激活函数替换为 sparsemax 激活函数,我们发现注意力头表现得似乎更透明:我们可以消融更少的头,且头在我们的可解释性度量上得分更高。但是,如果我们对 sparsemax 模型应用剪枝,我们发现可以剪枝甚至更多的头,这引发了强制稀疏是否真正改善透明度的疑问。最后,我们发现相对位置头似乎对摘要性能不可或缺,并在剪枝后持续保留。

关键词

引用

@article{arxiv.1911.03898,
  title  = {Understanding Multi-Head Attention in Abstractive Summarization},
  author = {Joris Baan and Maartje ter Hoeve and Marlies van der Wees and Anne Schuth and Maarten de Rijke},
  journal= {arXiv preprint arXiv:1911.03898},
  year   = {2019}
}