中文

TopK 语言模型

计算与语言 2025-06-27 v1

摘要

稀疏自编码器 (SAEs) 已成为分析和解释基于 Transformer 的语言模型 (LM) 激活空间的重要工具。然而,SAEs 存在若干缺陷,削弱了其实用性和内部有效性。由于 SAEs 是后置训练的,因此难以判断未发现特定概念是 SAEs 端的失败,还是由于底层 LM 不表示该概念所致。训练条件和架构选择会影响 SAEs 学习哪些特征。当追踪 LM 在训练期间学习概念的过程时,缺乏特征稳定性也使比较不同检查点中 SAEs 特征变得困难。为解决这些限制,我们在 Transformer 架构中引入一种修改,在选定层上采用 TopK 激活函数,使模型的隐藏状态等效于 TopK SAE 的潜在特征。该方法消除了后置训练的需求,同时提供了与 SAEs 相当的可解释性。 resulting TopK LMs 在模型大小、计算效率和可解释性之间提供了有利的权衡。尽管仅通过简单的架构变更,TopK LMs 仍保持原始能力,同时提供稳健的可解释性收益。我们的实验表明,TopK LMs 学习的稀疏表示支持通过针对性神经元干预实现定向操控,并促进对神经元形成过程在不同检查点和层之间的详细分析。这些特征使 TopK LMs 成为理解语言模型如何学习和表示概念的稳定可靠的工具,我们相信这将显著推动未来关于模型可解释性和可控性的研究。

关键词

引用

@article{arxiv.2506.21468,
  title  = {TopK Language Models},
  author = {Ryosuke Takahashi and Tatsuro Inaba and Kentaro Inui and Benjamin Heinzerling},
  journal= {arXiv preprint arXiv:2506.21468},
  year   = {2025}
}