Mnemosyne:用Transformer学习训练Transformer
机器学习
2023-06-21 v3 人工智能
摘要
本工作中,我们提出一类新的可学习优化器,称为 \textit{Mnemosyne}。它基于新颖的时空低秩隐式注意力Transformer,能够学习训练完整的神经网络架构(包括其他Transformer),而无需任何任务特定的优化器调参。我们表明Mnemosyne:(a)优于流行的LSTM优化器(我们也引入新的特征工程以缓解LSTM的灾难性遗忘);(b)可使用仅需极少计算资源的简单元训练策略成功训练Transformer;(c)在精度上与经过精心调参的SOTA手工设计优化器相当(常产生性能顶尖的模型)。此外,Mnemosyne的空间复杂度与其手工设计的一阶对应优化器相当,这使其能扩展到训练更大规模的参数集。我们对Mnemosyne进行了广泛的实证评估:(a)微调从中等规模架构到巨型ViT-H(36层,16头)的多种Vision Transformer(ViT);(b)预训练BERT模型;(c)软提示微调大型11B+ T5XXL模型。我们以对Mnemosyne所用紧凑联想记忆的全面理论分析补充了我们的结果,我们相信这是此前从未做过的。
引用
@article{arxiv.2302.01128,
title = {Mnemosyne: Learning to Train Transformers with Transformers},
author = {Deepali Jain and Krzysztof Marcin Choromanski and Avinava Dubey and Sumeet Singh and Vikas Sindhwani and Tingnan Zhang and Jie Tan},
journal= {arXiv preprint arXiv:2302.01128},
year = {2023}
}