中文

并非所有语言模型特征都是一维线性的

机器学习 2025-02-28 v3

摘要

最近的研究提出语言模型通过操作激活空间中概念的一维表示(“特征”)来进行计算。相反,我们探讨某些语言模型表示是否本质上是多维的。我们首先基于特征是否可以分解为独立或非共现的低维特征,发展出严格的不可约多维特征定义。受这些定义启发,我们设计了一种可扩展方法,使用稀疏自编码器自动发现 GPT-2 和 Mistral 7B 中的多维特征。这些自动发现的特征包括令人印象深刻的可解释实例,例如代表星期几和月份的圆形特征。我们识别出这些圆形特征用于解决涉及星期几和月份的模块运算问题的任务。随后,我们通过在 Mistral 7B 和 Llama 3 8B 上的干预实验提供证据,表明这些圆形特征确实是这些任务中基本计算单元的单位,并检查星期几特征在 Mistral 7B 中的连续性。总体而言,我们的工作主张,理解多维特征对于机械分解某些模型行为是必要的。

关键词

引用

@article{arxiv.2405.14860,
  title  = {Not All Language Model Features Are One-Dimensionally Linear},
  author = {Joshua Engels and Eric J. Michaud and Isaac Liao and Wes Gurnee and Max Tegmark},
  journal= {arXiv preprint arXiv:2405.14860},
  year   = {2025}
}

备注

Accepted to ICLR 2025. Code and data at https://github.com/JoshEngels/MultiDimensionalFeatures