语言模型训练中的隐藏突破
机器学习
2026-03-23 v4
摘要
在模型训练的大部分时间内,损失曲线都很平滑,因此可见的离散点脱颖而出,可能代表概念性的突破。通过对这些突破进行研究,可以更深入地理解学习动力学,但只有在它们被正确识别时才会如此。本文认为,类似的突破在训练过程中相当普遍,但它们被一种将所有变化折叠到单个标量的损失度量所遮蔽。为发现这些隐藏的转变,我们引入了 POLCA 方法,通过沿任意低秩训练子空间的基进行损失变化分解来实现这一目标。我们使用该方法识别出在训练期间共享相似损失变化的样本集群,将整体损失细分为来自概念相似数据子组的损失。我们在合成算术和自然语言任务上对方法进行验证,证明 POLCA 恢复的集群代表了模型能力的可解释性突破。我们展示了将这些隐藏相位转变作为无监督可解释性工具的潜力。
引用
@article{arxiv.2506.15872,
title = {Hidden Breakthroughs in Language Model Training},
author = {Sara Kangaslahti and Elan Rosenfeld and Naomi Saphra},
journal= {arXiv preprint arXiv:2506.15872},
year = {2026}
}
备注
ICLR 2026 Camera-ready