中文

将预训练Transformers微调为衰减快速权重

机器学习 2022-10-11 v1

摘要

自回归Transformers是强大的语言模型,但由于自注意力机制,在逐词生成时产生O(T)复杂度。近期工作提出基于核的方法,通过以不同更新规则和特征映射替代因果自注意力为循环形式,以实现O(1)时间与内存复杂度。我们探索了这些方法并发现它们不必要地复杂,进而提出一种简单替代——衰减快速权重——其在GPU上运行快速、优于先前方法,并为GPT-2保留了注意力99%的性能。我们还展示了在WikiText-103上相较于更复杂的注意力替代方案的竞争力。

关键词

引用

@article{arxiv.2210.04243,
  title  = {Fine-Tuning Pre-trained Transformers into Decaying Fast Weights},
  author = {Huanru Henry Mao},
  journal= {arXiv preprint arXiv:2210.04243},
  year   = {2022}
}