利用神经元嵌入应对多义性
机器学习
2024-11-14 v1
摘要
我们提出了神经元嵌入,这是一种可用于应对多义性的表示方法,通过识别神经元特征数据集示例中不同的语义行为,使得下游的手动或自动解释变得更加容易。我们将该方法应用于GPT2-small,并提供了一个用于探索结果的用户界面。神经元嵌入是使用模型的内部表示和权重计算得出的,这使得它们与领域和架构无关,并消除了引入可能不反映模型实际计算的外部结构的风险。我们描述了如何使用神经元嵌入来衡量神经元的多义性,这可用于更好地评估稀疏自编码器(SAE)的有效性。
引用
@article{arxiv.2411.08166,
title = {Tackling Polysemanticity with Neuron Embeddings},
author = {Alex Foote},
journal= {arXiv preprint arXiv:2411.08166},
year = {2024}
}