中文

语言模型训练中的隐藏突破

机器学习 2026-03-23 v4

摘要

在模型训练的大部分时间内,损失曲线都很平滑,因此可见的离散点脱颖而出,可能代表概念性的突破。通过对这些突破进行研究,可以更深入地理解学习动力学,但只有在它们被正确识别时才会如此。本文认为,类似的突破在训练过程中相当普遍,但它们被一种将所有变化折叠到单个标量的损失度量所遮蔽。为发现这些隐藏的转变,我们引入了 POLCA 方法,通过沿任意低秩训练子空间的基进行损失变化分解来实现这一目标。我们使用该方法识别出在训练期间共享相似损失变化的样本集群,将整体损失细分为来自概念相似数据子组的损失。我们在合成算术和自然语言任务上对方法进行验证,证明 POLCA 恢复的集群代表了模型能力的可解释性突破。我们展示了将这些隐藏相位转变作为无监督可解释性工具的潜力。

关键词

引用

@article{arxiv.2506.15872,
  title  = {Hidden Breakthroughs in Language Model Training},
  author = {Sara Kangaslahti and Elan Rosenfeld and Naomi Saphra},
  journal= {arXiv preprint arXiv:2506.15872},
  year   = {2026}
}

备注

ICLR 2026 Camera-ready