中文

情境结构塑造语言模型的表征几何

计算与语言 2026-02-02 v1 人工智能

摘要

大型语言模型 (LLM) 已被证明将输入序列的表征组织成深层中的更直线的神经轨迹,这被假定有助于通过线性外推进行下一个标记的预测。语言模型也能适应多样化的任务并在上下文中学习新结构,最近的工作表明,这种上下文学习 (ICL) 可反映在表征变化中。本文将这两条研究线结合起来,探讨在ICL期间表征直化是否发生。我们测量Gemma 2模型在多样化的上下文学习任务中的表征直化,发现LLM在上下文中的表征变化存在二元性。在持续预测情境(例如自然语言、网格世界遍历任务)中,我们观察到增加上下文会增加神经序列轨迹的直化程度,这与模型预测的改进相关。相反,在结构化预测情境(例如few-shot任务)中,直化是不一致的——它仅存在于具有显式结构的阶段(例如重复模板),而在其他阶段则消失。这些结果表明,ICL不是一种单一的过程。相反,我们提出LLM功能像十字刀:根据任务结构,LLM动态选择策略,只有其中一些策略才产生表征直化。

关键词

引用

@article{arxiv.2601.22364,
  title  = {Context Structure Reshapes the Representational Geometry of Language Models},
  author = {Eghbal A. Hosseini and Yuxuan Li and Yasaman Bahri and Declan Campbell and Andrew Kyle Lampinen},
  journal= {arXiv preprint arXiv:2601.22364},
  year   = {2026}
}