中文

信息通路假说:Transformer 是动态自集成模型

机器学习 2023-06-05 v1 人工智能

摘要

Transformer 使用稠密自注意力机制,为长程连接提供了极大灵活性。在深层 Transformer 的多层中,可能的连接模式数量呈指数增长。然而,其中极少部分对网络性能有贡献,更少的为关键所需。我们假说 Transformer 内部存在稀疏连接的子网络,称为信息通路,可独立训练。但这些通路的动态(即输入依赖)特性使得在训练中难以剪枝稠密自注意力。不过这些通路的整体分布往往可预测。我们利用此事实提出随机子采样自注意力(SSA)——一种通用 Transformer 训练策略,可在训练中将自注意力的内存与计算成本降低 4 至 8 倍,同时作为正则化方法提升相较稠密训练的泛化能力。我们展示可由网络内子采样通路形成子模型集成,其性能优于稠密注意力对应模型。我们在生成与判别设置下对多种 NLP、计算机视觉与图学习任务进行实验,为上述论断提供经验证据并展示所提方法的有效性。

关键词

引用

@article{arxiv.2306.01705,
  title  = {The Information Pathways Hypothesis: Transformers are Dynamic Self-Ensembles},
  author = {Md Shamim Hussain and Mohammed J. Zaki and Dharmashankar Subramanian},
  journal= {arXiv preprint arXiv:2306.01705},
  year   = {2023}
}

备注

KDD23 preprint, 12 pages, 7 figures, 10 tables