相同深度的层在不同 LLM 架构中生成相似的激活
计算与语言
2025-08-11 v3 人工智能
摘要
我们如何理解独立训练的大语言模型(LLM)所使用的潜在空间之间的关系?我们研究了 24 个开源 LLM 不同层上的激活所引发的最近邻关系,发现它们 1) 在单个模型中随层级而变化,且 2) 大致在不同模型对应层之间共享。命题 2 显示,这些最近邻关系并非随意,因为它们跨模型共享,但命题 1 说明它们也并非“显而易见”,因为不存在单一的被普遍共享的最近邻关系集合。这些发现表明,LLM 在层级间生成一种激活几何的进程,但整个进程在不同模型间基本共享,仅在不同架构中被拉伸和压缩。
引用
@article{arxiv.2504.08775,
title = {Layers at Similar Depths Generate Similar Activations Across LLM Architectures},
author = {Christopher Wolfram and Aaron Schein},
journal= {arXiv preprint arXiv:2504.08775},
year = {2025}
}