中文

时空中的故事:概念信念空间中的隐式学习轨迹

计算与语言 2026-05-13 v1 人工智能 机器学习

摘要

大型语言模型(LLM)在语境中的行为更新,可视为一种贝叶斯推断形式。然而,关于这一推断所依赖的潜在假设空间结构仍不清晰。本文提出,LLM 在分配概念信念空间——一种低维几何空间——上的信念上,隐式学习对应于随信念随时间更新而形成的轨迹。以故事理解为动态信念更新的自然场景,我们结合行为分析和表征分析来研究这些轨迹。我们发现:(1)信念更新可良好地描述为在低维、结构化流形上的轨迹;(2)这种结构在模型行为和内部表征中均得到一致反映,可通过简单的线性探针解码以预测行为;(3)对这些表征的干预可因果地引导信念轨迹,其效果可从概念空间的几何结构中预测。总体而言,本文提供了LLM信念动力学的几何解释,使贝叶斯解释的隐式学习在结构化概念表征中得到 grounding。

关键词

引用

@article{arxiv.2605.12412,
  title  = {Stories in Space: In-Context Learning Trajectories in Conceptual Belief Space},
  author = {Eric Bigelow and Raphaël Sarfati and Daniel Wurgaft and Owen Lewis and Thomas McGrath and Jack Merullo and Atticus Geiger and Ekdeep Singh Lubana},
  journal= {arXiv preprint arXiv:2605.12412},
  year   = {2026}
}