中文

利用可训练表示池化稀疏化 Transformer 模型

计算与语言 2022-03-08 v4 机器学习

摘要

我们提出一种新颖方法,通过在训练过程中学习选择最具信息量的词元表示来稀疏化 Transformer 模型中的注意力,从而聚焦于输入中特定于任务的部分。由于鲁棒的可训练 top-kk 算子,二次时间和内存复杂度降低至亚线性。我们在具有挑战性的长文档摘要任务上的实验表明,即便我们简单的基线也与当前 SOTA 相当,而通过可训练池化,我们能在保持顶尖质量的同时,训练速度提升 1.8×1.8\times,推理速度提升 4.5×4.5\times,解码器计算效率最高提升 13×13\times

关键词

引用

@article{arxiv.2009.05169,
  title  = {Sparsifying Transformer Models with Trainable Representation Pooling},
  author = {Michał Pietruszka and Łukasz Borchmann and Łukasz Garncarek},
  journal= {arXiv preprint arXiv:2009.05169},
  year   = {2022}
}

备注

Accepted at ACL 2022