深度 NLP 模型中显著神经元的发现
计算与语言
2024-01-17 v2
摘要
尽管在理解深度 NLP 模型内学习的表示及其捕获的知识方面已完成大量工作,但针对单个神经元的关注很少。我们提出了一种称为语言相关性分析的技术,以提取模型中相对于任何外在属性的显著神经元——旨在理解此类知识如何在神经元中保存。我们进行了细粒度分析以回答以下问题:(i) 我们能否识别网络中捕获特定语言属性的神经元子集?(ii) 神经元在网络中是局部化还是分布式分布的?(iii) 信息保存的冗余程度如何?(iv) 将预训练模型微调至下游 NLP 任务如何影响习得的语言知识?(v) 架构在学习不同语言属性方面如何变化?我们的数据驱动定量分析揭示了有趣发现:(i) 我们发现了可预测不同语言任务的小型神经元子集;(ii) 捕获基本词汇信息(如后缀)的神经元局部化在最底层;(iii) 而那些学习复杂概念(如句法角色)的神经元主要在中层和更高层;(iii) 在迁移学习中显著语言神经元从高层 relocated 至低层,因为网络将高层保留给任务特定信息;(iv) 我们发现预训练模型之间在语言信息如何被保存方面存在有趣差异;以及 (v) 我们发现多语言 transformer 模型中概念在不同语言间表现出相似的神经元分布。我们的代码作为 NeuroX 工具包的一部分公开可用。
引用
@article{arxiv.2206.13288,
title = {Discovering Salient Neurons in Deep NLP Models},
author = {Nadir Durrani and Fahim Dalvi and Hassan Sajjad},
journal= {arXiv preprint arXiv:2206.13288},
year = {2024}
}