中文

不同空间中的思考:域特定潜在几何在跨架构迁移中保持稳定

机器学习 2026-03-24 v1 人工智能

摘要

我们探讨了独立训练的语言模型是否收敛到几何兼容的潜在表征,以及这种兼容性是否可被利用而无需任何权重更新在推理时纠正模型行为。我们学习一个线性投影矩阵,将来自大型教师模型的激活向量映射到较小学生模型的坐标系中,然后通过替换学生模型内部状态来干预其残差流中的内部表示。我们进行了跨教师-学生配对的完全交叉实验,涵盖mixture-of-experts、稠密、代码专用和人工训练架构,Ridge投影在语言推理上实现R^2=0.50,在数学推理上实现R^2=0.40,在置换控制下降至R^2=-0.22,在L1正则化下降至R^2=0.01。行为纠正率在TruthfulQA上为14.0%至50.0%(平均25.2%),在GSM8K算术推理中为8.5%至43.3%(平均25.5%),表明该方法在根本不同的推理领域中具有普适性。我们报告几何对齐质量与行为纠正率之间接近零相关(r=-0.07),揭示了表示空间忠诚度与输出空间影响之间的解耦。干预强度具有架构特定性:学生模型表现出特征化的灵敏度轮廓,这些轮廓在不同领域中互为反转,最可操控的语言学生变为最不灵敏的数学学生。最后,跨所有20个模型配对进行的双向解耦实验无例外地表明,投影矩阵在推理领域间迁移时会灾难性崩溃(在两个推理方向上的平均R^2=-3.83),确立了域特定子空间几何作为大语言模型的普遍属性。

关键词

引用

@article{arxiv.2603.20406,
  title  = {Thinking in Different Spaces: Domain-Specific Latent Geometry Survives Cross-Architecture Translation},
  author = {Marcus Armstrong and Navid Ayoobi and Arjun Mukherjee},
  journal= {arXiv preprint arXiv:2603.20406},
  year   = {2026}
}