中文

语言崩塌:大语言模型中的神经崩塌

机器学习 2024-11-27 v3 计算与语言 机器学习

摘要

神经崩塌(NC\mathcal{NC})是一种在分类任务中观察到的现象,其中顶层表征会坍缩到其类别均值中,这些均值具有等范数、等角度并与分类器对齐。这些行为——与泛化和鲁棒性相关——在特定条件下显现:模型在零损失下训练,标签无噪声且属于平衡类别,且这些类别数量不超过模型隐藏维度。近期研究探索了NC\mathcal{NC}在缺少一个或多个条件下的情形,以延续其相关收益。语言建模 presents a curious frontier,因为"通过标记预测训练"构成一种分类任务,且不存在上述所有条件:词汇表不平衡且超过嵌入维度;不同标记可能对应相似的上下文嵌入;大型语言模型(LLMs)通常仅训练几个时代。本文经验性地考察了扩大架构和训练规模对因果语言模型(CLMs)向NC\mathcal{NC}过渡的影响。我们发现,随着规模(和正则化)发展的NC\mathcal{NC}性质与泛化相关。此外,仍有证据表明NC\mathcal{NC}与泛化之间存在某种关系,独立于规模。我们的工作从新更具挑战性的语言建模环境中阐明了NC\mathcal{NC}的普遍性。下游,我们旨在激发进一步的研究,以深化对LLMs——以及更广泛的神经网络——的理解,并改进基于NC\mathcal{NC}-相关性质的现有架构。我们的代码托管于GitHub,地址为https://github.com/rhubarbwu/linguistic-collapse。

关键词

引用

@article{arxiv.2405.17767,
  title  = {Linguistic Collapse: Neural Collapse in (Large) Language Models},
  author = {Robert Wu and Vardan Papyan},
  journal= {arXiv preprint arXiv:2405.17767},
  year   = {2024}
}

备注

NeurIPS 2024; 35 pages; 30 figures; reverted to log mean norms for NC2