DoLFIn:用于可解释性的潜特征分布方法
计算与语言
2020-11-11 v1
摘要
解释神经模型的内在工作机制是确保模型鲁棒性和可信性的关键一步,但神经网络的 Interpretability(可解释性)研究通常面临一种权衡:要么模型约束过强以致实用性不足,要么模型所发现的解决方案过于复杂而难以解释。我们提出了一种实现可解释性的新策略——在我们的实验中避免了这种权衡。我们的方法建立在以概率作为核心量的成功实践之上,例如注意力机制中所采用的那样。在我们的架构 DoLFIn(Distributions over Latent Features for Interpretability,用于可解释性的潜特征分布)中,我们不预先确定每个特征代表什么,特征共同构成一个无序集合。每个特征都有一个从 0 到 1 的关联概率,用于权衡其对后续处理的重要性。我们表明,与注意力和显著图方法不同,这种设置使得直接计算输入分量支持神经模型所做决策的概率变得直截了当。为证明该方法的实用性,我们将 DoLFIn 应用于文本分类,并表明 DoLFIn 不仅提供可解释的解决方案,甚至在 SST2 和 AG-news 数据集上略优于经典的 CNN 和 BiLSTM 文本分类器。
引用
@article{arxiv.2011.05295,
title = {DoLFIn: Distributions over Latent Features for Interpretability},
author = {Phong Le and Willem Zuidema},
journal= {arXiv preprint arXiv:2011.05295},
year = {2020}
}