大型语言模型的惊人鲁棒性:推理的阶段?
机器学习
2025-06-17 v3 人工智能
计算与语言
摘要
我们研究了大型语言模型(LLMs)对结构性干预的鲁棒性,通过删除和交换推理期间相邻的层。令人惊讶的是,在进行任何微调的情况下,模型仍能保留 72-95% 的原始顶部-1 预测准确率。我们发现性能退化并非在各层之间均匀分布:对早期和最终层的干预导致最严重的退化,而模型对丢弃中间层 remarkably robust。这种局部灵敏性模式激发了我们关于四个推理阶段的假设,这些阶段在各种模型家族和大小中均被观察到:(1)词嵌入被提升到更高层次表示的上下文整合;(2)任务和实体特定特征的迭代细化;(3)隐藏状态聚合为合理的下一个标记预测;(4)无关特征的抑制以最终确定输出分布。综合行为和机制证据,我们提供了一个解释深度相关计算的框架。
引用
@article{arxiv.2406.19384,
title = {The Remarkable Robustness of LLMs: Stages of Inference?},
author = {Vedang Lad and Jin Hwa Lee and Wes Gurnee and Max Tegmark},
journal= {arXiv preprint arXiv:2406.19384},
year = {2025}
}
备注
For Github code see https://github.com/vdlad/Remarkable-Robustness-of-LLMs. Send all correspondence to the first author