中文

向通用性迈进:研究跨语言模型架构的机制相似性

计算与语言 2024-10-11 v2

摘要

可解释性中的通用性假设认为,不同的神经网络可能在相同的任务上实现类似的算法。本文我们检验两种主流的语言建模架构,即 Transformer 和 Mamba,以探讨它们的机制相似性的程度。我们提出使用稀疏自编码器 (SAE) 从这些模型中隔离可解释特征,并表明大多数特征在这两种模型中相似。我们还验证了特征相似性与通用性之间的相关性。随后,我们深入分析 Mamba 模型的电路层次,发现 Mamba 中的归纳电路在结构上类似于 Transformer 中的归纳电路。我们还识别了一个细微差别,我们称之为 \emph{Off-by-One 动机}:一个 token 的信息在其下一个位置写入到 SSM 状态中。尽管 Transformer 中 token 之间的相互作用不显示此类趋势。

关键词

引用

@article{arxiv.2410.06672,
  title  = {Towards Universality: Studying Mechanistic Similarity Across Language Model Architectures},
  author = {Junxuan Wang and Xuyang Ge and Wentao Shu and Qiong Tang and Yunhua Zhou and Zhengfu He and Xipeng Qiu},
  journal= {arXiv preprint arXiv:2410.06672},
  year   = {2024}
}

备注

22 pages, 13 figures