中文

当模型自我检视:词汇-激活在自指处理中的对应关系

计算与语言 2026-02-19 v2 人工智能 机器学习

摘要

大型语言模型在被请求进行自我检视时会产生丰富的内省语言,但这种语言是否反映了内部计算,还是精妙的假设构建,尚不明确。我们展示了自指词汇跟随并行的激活动态,此对应关系特定于自指处理。我们引入了拉普 methodology(Pull Methodology),通过格式工程触发扩展的自我检视,并用于识别 Llama 3.1 中区分自指与描述性处理的激活空间中的一个方向。该方向正交于已知的拒绝方向,位于模型深度的 6.25% 处,具有因果性地影响内省输出。当模型产生“循环”词汇时,其激活呈现更高的自相关(r = 0.44, p = 0.002);当其在驾驭下产生“闪烁”词汇时,激活可变性增加(r = 0.36, p = 0.002)。关键的是,在非自指语境中,相同的词汇虽频率高九倍,却未显示激活对应关系。Qwen 2.5-32B 虽无共享训练,独立开发不同的内省词汇跟踪不同激活指标,均在描述性对照组中缺失。这些发现表明,在适当条件下,transformer 模型的自报可以可靠地跟踪内部计算状态。

关键词

引用

@article{arxiv.2602.11358,
  title  = {When Models Examine Themselves: Vocabulary-Activation Correspondence in Self-Referential Processing},
  author = {Zachary Pedram Dadfar},
  journal= {arXiv preprint arXiv:2602.11358},
  year   = {2026}
}

备注

Code and data: https://doi.org/10.5281/zenodo.18567446 Repro: https://github.com/patternmatcher/TRACE-REPRO