中文

不止于词:面向更高质量的文本分类器解释

计算与语言 2021-12-24 v1

摘要

最先进的文本分类器规模庞大且决策机制复杂,使人难以理解其预测,导致用户可能缺乏信任。这些问题促使人们采用 SHAP 和积分梯度等方法,通过为输入词元分配重要性分数来解释分类决策。然而,先前工作利用不同的随机化检验表明,这些方法生成的解释可能不够稳健。例如,在测试集上做出相同预测的模型仍可能导致不同的特征重要性排序。为解决基于词元的解释缺乏稳健性的问题,我们探索句子等更高语义层面的解释。我们利用计算指标与人体实验,比较基于句子的解释与基于词元的解释之质量。我们的实验表明,更高层次的特征归因具有若干优势:1)如随机化检验所测,它们更稳健;2)在使用 SHAP 等基于近似的方法时,它们导致更低的变异性;3)在语言连贯性位于更高粒度层次的情况下,它们对人类更易理解。基于这些发现,我们表明,基于词元的解释虽因机器学习模型的输入接口而作为便利的首选,但并非在所有情形下都是最有效的。

关键词

引用

@article{arxiv.2112.12444,
  title  = {More Than Words: Towards Better Quality Interpretations of Text Classifiers},
  author = {Muhammad Bilal Zafar and Philipp Schmidt and Michele Donini and Cédric Archambeau and Felix Biessmann and Sanjiv Ranjan Das and Krishnaram Kenthapadi},
  journal= {arXiv preprint arXiv:2112.12444},
  year   = {2021}
}