使用白盒 LSTM 评估归因方法
机器学习
2020-10-20 v1 计算与语言
摘要
神经网络的 Interpretability(可解释性)方法难以评估,因为我们不理解通常用于测试它们的黑盒模型。本文提出一个框架,其中使用人工构建的网络(我们称之为白盒网络)来评估可解释性方法,这些网络的行为是事先已知的。我们将五种生成归因热图的方法应用于基于形式语言的白盒 LSTM 分类器来进行评估。尽管我们的白盒分类器完美且透明地解决了其任务,但我们发现所有五种归因方法都未能产生预期的模型解释。
引用
@article{arxiv.2010.08606,
title = {Evaluating Attribution Methods using White-Box LSTMs},
author = {Yiding Hao},
journal= {arXiv preprint arXiv:2010.08606},
year = {2020}
}
备注
To appear in the Proceedings of the 2020 EMNLP Workshop BlackboxNLP: Analyzing and Interpreting Neural Networks for NLP