智能学习率分布以减少Transformer中的灾难性遗忘
计算与语言
2024-04-03 v1 人工智能
机器学习
摘要
在大型文本语料库上预训练语言模型是自然语言处理中的常见做法。然后对这些模型进行微调以在各种任务上取得最佳结果。在本文中,我们研究了Transformer神经网络中的灾难性遗忘问题,并质疑了在这种背景下对整个网络使用平坦学习率进行微调的常见做法。我们执行超参数优化过程,以找到比平坦学习率更好的学习率分布。我们将这样找到的学习率分布组合起来,并表明它们在灾难性遗忘问题上泛化到更好的性能。我们使用GLUE数据集中的各种NLP基准验证了这些学习率分布。
引用
@article{arxiv.2404.01317,
title = {Intelligent Learning Rate Distribution to reduce Catastrophic Forgetting in Transformers},
author = {Philip Kenneweg and Alexander Schulz and Sarah Schröder and Barbara Hammer},
journal= {arXiv preprint arXiv:2404.01317},
year = {2024}
}