锐度感知预训练缓解了灾难性遗忘
机器学习
2026-05-05 v1 计算与语言
摘要
预训练优化器被调校以产生最强的基础模型,认为更强的起点会导致后续更改(如后训练和量化)后的更强模型。这忽略了基础模型的几何,这控制了基础模型能力在后续参数更新后存活的程度。我们研究了三种偏向优化 toward更平坦局部 minima 的预训练方法:锐度感知最小化(SAM)、较大的学习率以及缩短的学习率退火周期。我们发现,在从2000万到15000万参数的模型规模上,这些干预在使用最高可达80%的后训练数据集后,始终改善了后续性能,减少了灾难性遗忘。这些原则在大规模情况下同样适用:对现有OLMo-2-1B检查点进行短时SAM中训练后,MetaMath后训练的灾难性遗忘减少31%,4位量化后减少40%。
引用
@article{arxiv.2605.02105,
title = {Sharpness-Aware Pretraining Mitigates Catastrophic Forgetting},
author = {Ishaan Watts and Catherine Li and Sachin Goyal and Jacob Mitchell Springer and Aditi Raghunathan},
journal= {arXiv preprint arXiv:2605.02105},
year = {2026}
}
备注
43 pages, 64 figures, 9 tables, accepted to ICML2026