中文

Transformer 注意力头在生成式摘要中是否提供了透明性?

计算与语言 2019-07-09 v2 人工智能 信息检索 机器学习

摘要

学习算法变得更加强大,往往以增加复杂性为代价。作为回应,对算法透明性的需求正在增长。在 NLP 任务中,基于注意力的深度学习模型学习到的注意力分布被用于洞察模型的行为。这种观点在多大程度上对所有 NLP 任务有效?我们研究 Transformer 架构中不同注意力头计算的分布是否可用于提高生成式摘要任务的透明性。为此,我们提出定性和定量分析以研究注意力头的行为。我们表明,某些注意力头确实专门针对句法和语义上不同的输入。我们提出一种方法来评估 Transformer 模型在多大程度上依赖于特定学习到的注意力分布。我们还讨论了这对将注意力分布作为透明性手段意味着什么。

关键词

引用

@article{arxiv.1907.00570,
  title  = {Do Transformer Attention Heads Provide Transparency in Abstractive Summarization?},
  author = {Joris Baan and Maartje ter Hoeve and Marlies van der Wees and Anne Schuth and Maarten de Rijke},
  journal= {arXiv preprint arXiv:1907.00570},
  year   = {2019}
}

备注

To appear at FACTS-IR 2019, SIGIR