中文

具有独立机制竞争集成模块的 Transformer

机器学习 2021-03-02 v1 人工智能

摘要

从最早的 MLP 开始,深度学习的一个重要进展是转向具有结构性归纳偏置的架构,使模型能够保持不同信息源与处理路径的良好分离。该结构与因果文献中独立机制的概念相关:当世界中无关方面发生变化时,某一机制仍能保持相同的处理。例如,卷积网络实现了位置上的分离,而基于注意力的架构(尤其是 Transformer)动态学习应处理哪些位置组合。在本工作中,我们探讨了 Transformer 架构的一个缺陷:它以一个庞大的整体化隐藏表示和一组应用于整个隐藏表示的参数来表示每个位置。这可能将不相关的信息源混杂在一起,并限制 Transformer 捕捉独立机制的能力。为此,我们提出具有独立机制的 Transformer(TIM),一种将隐藏表示与参数划分为多个机制、仅通过注意力进行信息交换的新型 Transformer 层。此外,我们提出一种竞争机制,鼓励这些机制随时间步专门化,从而更加独立。我们在大规模 BERT 模型、Image Transformer 以及语音增强上研究 TIM,发现了具有语义意义的专门化证据及性能提升。

关键词

引用

@article{arxiv.2103.00336,
  title  = {Transformers with Competitive Ensembles of Independent Mechanisms},
  author = {Alex Lamb and Di He and Anirudh Goyal and Guolin Ke and Chien-Feng Liao and Mirco Ravanelli and Yoshua Bengio},
  journal= {arXiv preprint arXiv:2103.00336},
  year   = {2021}
}

备注

Under Review, ICML 2021