从多粒子动力系统视角理解并改进Transformer
机器学习
2019-06-10 v1 计算与语言
机器学习
摘要
Transformer架构在自然语言处理中被广泛使用。尽管其取得成功,Transformer的设计原理仍难以捉摸。本文提供一种理解该架构的新视角:我们表明Transformer可从数学上解释为多粒子动力系统中对流-扩散方程的数值常微分方程(ODE)求解器。具体而言,句子中词通过Transformer各层被抽象为上下文的过程,可解释为使用Lie-Trotter分裂格式与Euler方法近似多个粒子在空间中的运动。基于该ODE视角,数值分析的丰富文献可用来指导我们设计超越Transformer的有效结构。作为一个例子,我们提议用Strang-Marchuk分裂格式替代Lie-Trotter分裂格式,后者更为常用且局部截断误差更低。Strang-Marchuk分裂格式表明,自注意力与位置前馈网络(FFN)子层不应被平等对待。相反,在每一层中应使用两个位置FFN子层,并将自注意力子层置于其间。这导出了一种全新的架构。这种FFN-注意力-FFN层呈“马卡龙状”,因此我们称具有此新架构的网络为Macaron Net。通过大量实验,我们表明Macaron Net在有监督与无监督学习任务上均优于Transformer。可复现代码与预训练模型见 https://github.com/zhuohan123/macaron-net
引用
@article{arxiv.1906.02762,
title = {Understanding and Improving Transformer From a Multi-Particle Dynamic System Point of View},
author = {Yiping Lu and Zhuohan Li and Di He and Zhiqing Sun and Bin Dong and Tao Qin and Liwei Wang and Tie-Yan Liu},
journal= {arXiv preprint arXiv:1906.02762},
year = {2019}
}