中文

Curved Inference:大语言模型残差流中的关注敏感几何

计算与语言 2025-07-30 v1 人工智能

摘要

我们提出 Curved Inference——一个几何可解释性框架,用于追踪大语言模型的残差流轨迹如何响应语义关注点的变化而产生弯曲。在涵盖情感、道德、视角、逻辑、身份、环境和无意义领域的 20 个匹配提示中,我们使用五个原生空间指标分析了 Gemma3-1b 和 LLaMA3.2-3b,重点关注曲率(\k{appa}_i)和显著度(S(t))。这些指标是在源自反嵌入矩阵的拉回语义度量下计算的,确保所有测量反映的是与词元对齐的几何结构,而非原始坐标结构。我们发现,关注点偏移的提示可靠地改变了两个模型的内部激活轨迹——随着关注强度的增加,LLaMA 在曲率和显著度上表现出一致的、具有统计学显著性的缩放。Gemma 也会对关注点做出响应,但在中等和强烈变体之间的区分较弱。我们的结果支持了对 LLM 几何结构的双层视角——即嵌入空间中编码的潜在概念结构,以及由特定于提示的推理塑造的上下文轨迹。Curved Inference 揭示了模型如何随深度导航、重新定向或强化语义,为诊断对齐、抽象和涌现推理动态提供了一种有原则的方法。这些发现通过 Curved Inference 的视角为语义抽象和模型对齐提供了新见解。

关键词

引用

@article{arxiv.2507.21107,
  title  = {Curved Inference: Concern-Sensitive Geometry in Large Language Model Residual Streams},
  author = {Rob Manson},
  journal= {arXiv preprint arXiv:2507.21107},
  year   = {2025}
}

备注

29 pages, 22 figures