Transformer 中的突变式学习:以矩阵补全为例
机器学习
2024-10-30 v1 机器学习
摘要
近期对 Transformer 训练动态的分析揭示了一个有趣的特征:训练损失在大量训练步数内处于平台期,随后突然(且急剧地)下降至接近最优值。为深入理解这一现象,我们将低秩矩阵补全问题形式化为一个掩码语言建模(MLM)任务,并证明训练一个 BERT 模型以低误差解决此任务是可行的。此外,尽管训练过程或超参数没有任何变化,损失曲线仍显示出训练早期的平台期,随后突然下降至接近最优值。为获得对这一突然下降的可解释性洞察,我们检查了模型在此转变前后的预测、注意力头和隐藏状态。具体而言,我们观察到:(a) 模型从简单复制掩码输入转变为准确预测掩码条目;(b) 注意力头转变为与任务相关的可解释模式;(c) 嵌入和隐藏状态编码了与问题相关的信息。我们还分析了单个模型组件的训练动态,以理解损失的突然下降。
引用
@article{arxiv.2410.22244,
title = {Abrupt Learning in Transformers: A Case Study on Matrix Completion},
author = {Pulkit Gopalani and Ekdeep Singh Lubana and Wei Hu},
journal= {arXiv preprint arXiv:2410.22244},
year = {2024}
}
备注
NeurIPS 2024 Poster