中文

BERT 的一种可解释性错觉

计算与语言 2021-04-16 v1 机器学习

摘要

我们描述了在分析 BERT 模型时出现的一种“可解释性错觉”。网络中单个神经元的激活可能虚假地表现为编码单一、简单的概念,而实际上它们编码的是远为复杂的内容。同样的效应也适用于激活的线性组合。我们将这种错觉的源头追溯至 BERT 嵌入空间的几何特性,以及常见文本语料仅代表可能英语句子的狭窄切片这一事实。我们提供了模型习得概念的分类体系,并讨论了可解释性研究的方法论启示,特别是在多个数据集上检验假设的重要性。

关键词

引用

@article{arxiv.2104.07143,
  title  = {An Interpretability Illusion for BERT},
  author = {Tolga Bolukbasi and Adam Pearce and Ann Yuan and Andy Coenen and Emily Reif and Fernanda Viégas and Martin Wattenberg},
  journal= {arXiv preprint arXiv:2104.07143},
  year   = {2021}
}