中文

语言模型决策的几何结构

机器学习 2025-11-26 v1 人工智能 计算与语言

摘要

大型语言模型 (LLM) 在 diverse 任务上表现出强大的泛化能力,但其预测背后的内部决策过程仍然是黑箱。本工作通过内在维数 (ID) 的视角研究 LLM 中隐藏表示的几何结构,具体聚焦于多选问答 (MCQA) 场景中的决策动态。我们进行了大规模研究,使用 28 个开源权重变换模型并通过多种估计器估计 ID,同时量化每层在 MCQA 任务上的性能。我们的发现揭示了跨模型一致的 ID 模式:早期层在低维流形上工作,中期层扩大此空间,后期层再次压缩其尺寸,最终收敛于决策相关的表示。这些结果表明,LLM 隐式学习将语言输入投影到与任务相关决策对齐的结构化低维流形上,为理解语言模型中如何产生泛化和推理提供了新的几何视角。

关键词

引用

@article{arxiv.2511.20315,
  title  = {Geometry of Decision Making in Language Models},
  author = {Abhinav Joshi and Divyanshu Bhatt and Ashutosh Modi},
  journal= {arXiv preprint arXiv:2511.20315},
  year   = {2025}
}

备注

Accepted at NeurIPS 2025