中文

ATLAS:面向语言模型与神经扰动数据的宪法条件化潜在几何与 Redistribution

机器学习 2026-04-21 v1 人工智能 计算与语言

摘要

宪法条件化的后训练可作为模型学习表示几何的结构化扰动进行分析。我们引入 ATLAS,这是一个以几何为导向的程序,追踪跨图表、模型与基质的宪法诱导隐藏状态结构。ATLAS 并不将相关单元视为单个行为、神经元、向量或块,而是测试其局部图表,其切向结构、占用分布与行为耦合可在系统变化下被测量。在 Gemma 上,锚定的源局部图表捕获了 310/320 条被审查的源行和全部 84/84 条被审查的得分翻转行,但紧凑的精确补丁充分性并未闭合,因此可导出的单元是更广义的源定义族。冻结该族,我们在未调整的 Phi 模型中重新识别目标局部实现,完全认可的确认性对比在 AUC 为 0.984 且均值间隔为 5.50 时分离。在held-out ALM8 小鼠前额皮层扰动数据中,同一源定义族在5/5折中均得到支持,平均held-out AUC 为 0.72,平均折间隔为 4.50。多选分析提供了主要边界:相邻的目标局部信号可在无源忠实闭合的情况下出现。 resulting correspondence 不是坐标同一性、位置同一性,也非目标侧中介定理。它是 Redistribution 下的几何复现:书面宪法可诱导可恢复的潜在几何,其组织在模型与基质变化下仍可被检测到,而其局部坐标、占用情况与行为表达会发生变化。

关键词

引用

@article{arxiv.2604.17663,
  title  = {ATLAS: Constitution-Conditioned Latent Geometry and Redistribution Across Language Models and Neural Perturbation Data},
  author = {Gareth Seneque and Lap-Hang Ho and Nafise Erfanian Saeedi and Jeffrey Molendijk and Tim Elson},
  journal= {arXiv preprint arXiv:2604.17663},
  year   = {2026}
}

备注

49 pages, 7 figures