中文

语义收敛:探究规模不同的大语言模型之间的共享表征

计算与语言 2025-08-01 v1 机器学习

摘要

我们研究了Gemma-2语言模型(Gemma-2-2B和Gemma-2-9B)中的特征通用性,探讨参数规模相差四倍的模型是否仍在可比较的内部概念上收敛。使用稀疏自编码器(SAE)字典学习管道,对每个模型的残差流激活应用SAE,通过激活相关性对结果单语义特征进行对齐,并使用SVCCA和RSA比较匹配后的特征空间。中层层次产生最强的重叠,早期和后期层显示出显著更少的相似性。初步实验将分析范围从单个标记扩展到多标记子空间,表明语义相似的子空间在与语言模型交互时表现相似。这一结果强化了大语言模型即使在规模不同的情况下,也会将世界划分为广泛相似、可解释的特征,强化了作为跨模型可解释性基础的普遍性。

关键词

引用

@article{arxiv.2507.22918,
  title  = {Semantic Convergence: Investigating Shared Representations Across Scaled LLMs},
  author = {Daniel Son and Sanjana Rathore and Andrew Rufail and Adrian Simon and Daniel Zhang and Soham Dave and Cole Blondin and Kevin Zhu and Sean O'Brien},
  journal= {arXiv preprint arXiv:2507.22918},
  year   = {2025}
}

备注

Submitted to ACL 2025 Student Research Workshop (poster)