Transformer中层权重矩阵的贪心排序提升翻译质量
计算与语言
2023-03-20 v3 人工智能
神经与进化计算
摘要
先前的工作试图在多头注意力和前馈子层层面理解基于Transformer的编码器-解码器架构的内部结构与功能。这些解释主要关注编码器和解码器,以及自注意力、交叉注意力和前馈子层的组合可能性。然而,若不检查底层结构,我们对子层重排序背后的动机理解有限。我们能否深入子层抽象,通过置换层权重矩阵来提升翻译质量?我们提出AEIUOrder方法,根据由重尾自正则化(HT-SR)指标衡量的训练充分度,贪心地对编码器中的层权重矩阵进行重排序,并相应地对解码器矩阵进行排序。我们的结果表明,贪心地重排序层权重矩阵以最大化总体训练充分度,有助于模型更有效地学习表示并生成翻译。
引用
@article{arxiv.2302.02123,
title = {Greedy Ordering of Layer Weight Matrices in Transformers Improves Translation},
author = {Elicia Ye},
journal= {arXiv preprint arXiv:2302.02123},
year = {2023}
}
备注
The paper contains an error in the implementation of the algorithm