当注意力遇上快速循环:以更低计算量训练语言模型
计算与语言
2021-09-16 v3 机器学习
摘要
由于计算时间与成本不断增长,大型语言模型的训练变得愈发困难。在本工作中,我们提出 SRU++,一种结合快速循环与注意力机制用于序列建模的高效架构。SRU++ 展现出强大的建模能力与训练效率。在 Enwik8、Wiki-103 和 Billion Word 等标准语言建模任务上,与性能最优的 Transformer 模型相比,我们的模型在使用 3 至 10 倍更少训练成本的同时,取得了更优的每字符比特数和困惑度。例如,我们的模型在 8 块 GPU 的机器上训练 1.6 天即在 Enwik8 数据集上取得当前最优结果。我们进一步证明,SRU++ 仅需极少量注意力即可达到接近最优的性能。我们的结果表明,联合利用快速循环与少量注意力是加速模型训练与推理的一个有前景的方向。
引用
@article{arxiv.2102.12459,
title = {When Attention Meets Fast Recurrence: Training Language Models with Reduced Compute},
author = {Tao Lei},
journal= {arXiv preprint arXiv:2102.12459},
year = {2021}
}