中文

信念还是电路?关于原位图学习的因果证据

人工智能 2026-05-12 v1 机器学习

摘要

大型语言模型如何进行原位学习?是通过模式匹配最近的标记,还是通过推断潜在结构?我们使用一个玩具图随机漫步任务来探测这一问题,该任务的答案原则上是可决定的:模型是跟踪全局拓扑结构,还是复制局部转换。我们提出了两线证据表明,单凭其中一种解释都不足以解释现象。首先,通过 PCA 恢复内部表示结构发现,在中间混合比例下,两种图拓扑结构同时被编码在正交的主成分子空间中。这一模式与纯粹的局部转换复制难以一致。其次,残差流激活修补和图差引导在因果上干扰这一图家族信号:后层修补几乎完全转移干净的图偏好,而线性引导则将预测移动到预期方向,并在范数匹配和标签随机化控制下失败。综合来看,我们的发现最符合一种双机制模型,即真正的结构推断和归纳电路并行运作的解释。

关键词

引用

@article{arxiv.2605.08405,
  title  = {Belief or Circuitry? Causal Evidence for In-Context Graph Learning},
  author = {Katharine Kowalyshyn and Timothy Duggan and Daniel Little and Michael C Hughes},
  journal= {arXiv preprint arXiv:2605.08405},
  year   = {2026}
}

备注

Under review at ICML Mechanistic Interpretability Workshop 2026