将残差与归一化层纳入掩码语言模型的分析
计算与语言
2021-09-16 v1
摘要
Transformer 架构已在自然语言处理领域无处不在。为解释基于 Transformer 的模型,其注意力模式已被广泛分析。然而,Transformer 架构不仅由多头注意力构成;其他组件亦可能对 Transformer 渐进式的性能表现有所贡献。在本研究中,我们将 Transformer 的分析范围从仅关注注意力模式扩展至整个注意力块,即多头注意力、残差连接与层归一化。我们对基于 Transformer 的掩码语言模型的分析表明,经由注意力实现的词元间交互对中间表征的影响小于此前的假设。这些结果为已有报道提供了新的直观解释;例如,丢弃学习到的注意力模式往往不会对性能产生不利影响。我们的实验代码已公开可用。
引用
@article{arxiv.2109.07152,
title = {Incorporating Residual and Normalization Layers into Analysis of Masked Language Models},
author = {Goro Kobayashi and Tatsuki Kuribayashi and Sho Yokoi and Kentaro Inui},
journal= {arXiv preprint arXiv:2109.07152},
year = {2021}
}
备注
22 pages, accepted to EMNLP 2021 main conference