BERT 的一种可解释性错觉
计算与语言
2021-04-16 v1 机器学习
摘要
我们描述了在分析 BERT 模型时出现的一种“可解释性错觉”。网络中单个神经元的激活可能虚假地表现为编码单一、简单的概念,而实际上它们编码的是远为复杂的内容。同样的效应也适用于激活的线性组合。我们将这种错觉的源头追溯至 BERT 嵌入空间的几何特性,以及常见文本语料仅代表可能英语句子的狭窄切片这一事实。我们提供了模型习得概念的分类体系,并讨论了可解释性研究的方法论启示,特别是在多个数据集上检验假设的重要性。
引用
@article{arxiv.2104.07143,
title = {An Interpretability Illusion for BERT},
author = {Tolga Bolukbasi and Adam Pearce and Ann Yuan and Andy Coenen and Emily Reif and Fernanda Viégas and Martin Wattenberg},
journal= {arXiv preprint arXiv:2104.07143},
year = {2021}
}