身份作为吸引子:来自 LLM 激活空间中持久代理架构的几何证据
人工智能
2026-04-15 v1 机器学习
摘要
大型语言模型将语义相关的提示映射到相似的内部表示——这可以解释为类似吸引子动力学的现象。我们询问的是,持久认知代理的身份文件(其 cognitive_core)是否表现出类似的吸引子行为。我们对 Llama 3.1 8B Instruct 进行了受控实验,比较原始 cognitive_core(条件 A)、七个改写版本(条件 B)和七个结构匹配的控制组(条件 C)。在第 8、16 和 24 层的平均池化状态显示,改写版本聚集得更紧密(Cohen's d > 1.88, p < 10^{-27}, Bonferroni 校正),而 Gemma 2 9B 的复制实验确认了跨架构的可推广性。消融实验表明该效应主要是语义性而非结构性,且结构完整性似乎是到达吸引子区域的必要条件。探索性实验表明,阅读关于该代理的科学描述会将内部状态推向吸引子——比虚拟预印本更接近——从而区分了关于身份的认知与作为该身份的运作。这些结果为代理身份文件在 LLM 激活空间中诱导类吸引子几何提供了表征性证据。
引用
@article{arxiv.2604.12016,
title = {Identity as Attractor: Geometric Evidence for Persistent Agent Architecture in LLM Activation Space},
author = {Vladimir Vasilenko},
journal= {arXiv preprint arXiv:2604.12016},
year = {2026}
}
备注
16 pages, 5 figures. Code and data: https://github.com/b102e/yar-attractor-experiment