将预训练Transformers微调为衰减快速权重
机器学习
2022-10-11 v1
摘要
自回归Transformers是强大的语言模型,但由于自注意力机制,在逐词生成时产生O(T)复杂度。近期工作提出基于核的方法,通过以不同更新规则和特征映射替代因果自注意力为循环形式,以实现O(1)时间与内存复杂度。我们探索了这些方法并发现它们不必要地复杂,进而提出一种简单替代——衰减快速权重——其在GPU上运行快速、优于先前方法,并为GPT-2保留了注意力99%的性能。我们还展示了在WikiText-103上相较于更复杂的注意力替代方案的竞争力。
引用
@article{arxiv.2210.04243,
title = {Fine-Tuning Pre-trained Transformers into Decaying Fast Weights},
author = {Huanru Henry Mao},
journal= {arXiv preprint arXiv:2210.04243},
year = {2022}
}