中文

DenseFormer:通过深度加权平均增强 Transformer 中的信息流

计算与语言 2024-03-22 v2 机器学习

摘要

Vaswani 等人 (2017) 提出的 Transformer 架构现已遍布从自然语言处理到语音处理和图像理解等应用领域。我们提出了 DenseFormer,这是对标准架构的一种简单修改,可在不增加模型大小的情况下改善模型的困惑度(perplexity)——对于参数量在 100B 范围的大规模模型,仅增加几千个参数。我们的方法依赖于在每个 Transformer 块之后添加一个额外的平均步骤,该步骤计算当前表示与过去表示的加权平均——我们将此操作称为深度加权平均(Depth-Weighted-Average, DWA)。学习到的 DWA 权重展现出连贯的信息流模式,揭示了来自遥远层激活值的强烈且结构化的重用。实验表明,DenseFormer 具有更高的数据效率,能够达到与更深 Transformer 模型相同的困惑度;且在相同困惑度下,这些新模型在内存效率和推理时间方面优于 Transformer 基线。

关键词

引用

@article{arxiv.2402.02622,
  title  = {DenseFormer: Enhancing Information Flow in Transformers via Depth Weighted Averaging},
  author = {Matteo Pagliardini and Amirkeivan Mohtashami and Francois Fleuret and Martin Jaggi},
  journal= {arXiv preprint arXiv:2402.02622},
  year   = {2024}
}