中文

利用神经元嵌入应对多义性

机器学习 2024-11-14 v1

摘要

我们提出了神经元嵌入,这是一种可用于应对多义性的表示方法,通过识别神经元特征数据集示例中不同的语义行为,使得下游的手动或自动解释变得更加容易。我们将该方法应用于GPT2-small,并提供了一个用于探索结果的用户界面。神经元嵌入是使用模型的内部表示和权重计算得出的,这使得它们与领域和架构无关,并消除了引入可能不反映模型实际计算的外部结构的风险。我们描述了如何使用神经元嵌入来衡量神经元的多义性,这可用于更好地评估稀疏自编码器(SAE)的有效性。

关键词

引用

@article{arxiv.2411.08166,
  title  = {Tackling Polysemanticity with Neuron Embeddings},
  author = {Alex Foote},
  journal= {arXiv preprint arXiv:2411.08166},
  year   = {2024}
}