论语言模型中单个神经元分析的陷阱
计算与语言
2022-08-02 v3
摘要
尽管许多研究表明语言信息被编码在隐藏词表示中,但很少有研究关注单个神经元,以揭示信息是如何以及在哪些神经元中被编码的。在这些研究中,常见的方法是使用外部探针根据神经元与某些语言属性的相关性对其进行排序,并使用产生该排序的同一探针来评估所获得的排序。我们揭示了这种方法论中的两个陷阱:1. 它混淆了两个不同的因素:探针质量和排序质量。我们将它们分开,并对每个因素分别得出结论。2. 它关注的是被编码的信息,而非模型实际使用的信息。我们证明这两者并不相同。我们比较了两种最近的排序方法和我们引入的一种简单方法,并针对这两个方面对它们进行了评估。
引用
@article{arxiv.2110.07483,
title = {On the Pitfalls of Analyzing Individual Neurons in Language Models},
author = {Omer Antverg and Yonatan Belinkov},
journal= {arXiv preprint arXiv:2110.07483},
year = {2022}
}
备注
ICLR 2022 Main Conference