中文

LLM 中稀疏自编码器特征的层级演化

机器学习 2024-11-19 v2

摘要

基于转换器的语言模型的稀疏自编码器(Sparse Autoencoders)通常独立定义于每个层。本文分析了相邻层之间特征的统计关系,以理解特征在前向传递过程中的演化。我们提供了一个用于可视化特征及其最相似的下一层邻居的图形界面(https://stefanhex.com/spar-2024/feature-browser/),并构建了跨层的相关特征社区。我们发现,相当大比例的特征从前一层传递而来,一些特征可以表示为前一层特征的准布尔组合,一些特征在后续层中变得更具专业化。

关键词

引用

@article{arxiv.2410.08869,
  title  = {Evolution of SAE Features Across Layers in LLMs},
  author = {Daniel Balcells and Benjamin Lerner and Michael Oesterle and Ediz Ucar and Stefan Heimersheim},
  journal= {arXiv preprint arXiv:2410.08869},
  year   = {2024}
}

备注

Presented at the Attributing Model Behavior at Scale (ATTRIB) workshop at NeurIPS 2024