中文

训练Transformer时打破对称性

机器学习 2024-06-18 v2 计算与语言

摘要

正如我们在本文中所展示的,在缺少位置编码和因果注意力机制之一的情况下,Transformer架构对输出token n+1n+1 的预测对于输入token 1,2,...,n11, 2, ..., n-1 的排列具有不变性。通常,这两种机制会被同时采用,从而打破相对于输入token的对称性。最近的研究表明,可以在没有位置编码的情况下训练Transformer。这必然是由因果注意力机制所启用的。在本文中,我们详细论证了因果连接机制必然是Transformer能够对顺序重要的输入序列进行建模的原因。Transformer的垂直“切片”都被鼓励去表示输入序列中的同一位置 kk。我们假设残差连接促成了这一现象,并展示了相关证据。

关键词

引用

@article{arxiv.2402.05969,
  title  = {Breaking Symmetry When Training Transformers},
  author = {Chunsheng Zuo and Michael Guerzhoy},
  journal= {arXiv preprint arXiv:2402.05969},
  year   = {2024}
}