偏移越大,表征越稀疏:分析 LLM 中的 OOD 机制
计算与语言
2026-03-20 v2 人工智能
摘要
本文探讨了大型语言模型(LLM)在面对难度递增输入时的内部表征如何适应。我们揭示了一个一致且可量化的现象:随着任务难度增加,无论是通过更难的推理问题、更长的上下文,还是增加答案选项,LLM 的最后隐藏状态都会显著变得更稀疏。简而言之,\textbf{\textit{偏移越大,表征越稀疏}。}这种稀疏性-难度关系在不同模型和领域中均可观察,表明语言模型会通过将计算集中到最后隐藏状态的专用子空间中,对不熟悉或复杂的输入作出响应。通过一系列受控分析及学习动力学解释,我们展示了这种稀疏性并非偶然,而是一种稳定 OOD 环境下推理的自适应机制。借助这一洞见,我们设计了 \textit{稀疏性引导的课程中内学习(SG-ICL)},一种显式利用表征稀疏性安排少样本演示的策略,显著提升了性能。本研究为理解 LLM 如何内化 OOD 挑战提供了新的机制性见解。源码地址:https://github.com/MingyuJ666/sparsityLLM。
引用
@article{arxiv.2603.03415,
title = {Farther the Shift, Sparser the Representation: Analyzing OOD Mechanisms in LLMs},
author = {Mingyu Jin and Yutong Yin and Jingcheng Niu and Qingcheng Zeng and Wujiang Xu and Mengnan Du and Wei Cheng and Zhaoran Wang and Tianlong Chen and Dimitris N. Metaxas},
journal= {arXiv preprint arXiv:2603.03415},
year = {2026}
}