中文

利用特征文本化探究 BERT 神经元中词的编码

计算与语言 2023-11-15 v1 人工智能

摘要

预训练语言模型(PLMs)构成了大多数最先进 NLP 技术的基础。然而,它们本质上是黑盒:人类并不清楚模型不同部分尤其是单个神经元中编码了何种知识。计算机视觉中的情况不同,特征可视化为视觉模型神经元提供了一种分解式可解释性技术。激活最大化被用于合成神经元所编码信息的内在可解释视觉表征。我们的工作受此启发,但基于首次大规模将激活最大化适配到 NLP、更具体地大型 PLMs 的尝试,呈现了关于单神经元可解释性的警示故事。我们提出特征文本化,一种在 PLM 词嵌入空间中生成神经元稠密表征的技术。我们将特征文本化应用于 BERT 模型(Devlin et al., 2019)以探究单个神经元中编码的知识是否可被解释和符号化。我们发现所生成的表征可提供关于单个神经元中编码知识的洞见,但单个神经元并不表示诸如词这类清晰的语言符号单元。此外,我们利用特征文本化探究 BERT 中编码词需要多少个神经元。

关键词

引用

@article{arxiv.2311.08240,
  title  = {Investigating the Encoding of Words in BERT's Neurons using Feature Textualization},
  author = {Tanja Baeumel and Soniya Vijayakumar and Josef van Genabith and Guenter Neumann and Simon Ostermann},
  journal= {arXiv preprint arXiv:2311.08240},
  year   = {2023}
}

备注

To be published in 'BlackboxNLP 2023: The 6th Workshop on Analysing and Interpreting Neural Networks for NLP'. Camera-ready version