中文

大型语言模型的惊人鲁棒性:推理的阶段?

机器学习 2025-06-17 v3 人工智能 计算与语言

摘要

我们研究了大型语言模型(LLMs)对结构性干预的鲁棒性,通过删除和交换推理期间相邻的层。令人惊讶的是,在进行任何微调的情况下,模型仍能保留 72-95% 的原始顶部-1 预测准确率。我们发现性能退化并非在各层之间均匀分布:对早期和最终层的干预导致最严重的退化,而模型对丢弃中间层 remarkably robust。这种局部灵敏性模式激发了我们关于四个推理阶段的假设,这些阶段在各种模型家族和大小中均被观察到:(1)词嵌入被提升到更高层次表示的上下文整合;(2)任务和实体特定特征的迭代细化;(3)隐藏状态聚合为合理的下一个标记预测;(4)无关特征的抑制以最终确定输出分布。综合行为和机制证据,我们提供了一个解释深度相关计算的框架。

关键词

引用

@article{arxiv.2406.19384,
  title  = {The Remarkable Robustness of LLMs: Stages of Inference?},
  author = {Vedang Lad and Jin Hwa Lee and Wes Gurnee and Max Tegmark},
  journal= {arXiv preprint arXiv:2406.19384},
  year   = {2025}
}

备注

For Github code see https://github.com/vdlad/Remarkable-Robustness-of-LLMs. Send all correspondence to the first author