中文

利用概念反事实解释对有意义的模型错误进行调试

机器学习 2022-06-16 v3

摘要

理解和解释训练模型所犯的错误对许多机器学习目标至关重要,例如提升鲁棒性、应对概念漂移和缓解偏差。然而,这通常是一个临时过程,涉及手动查看模型在许多测试样本上的错误并猜测这些错误预测的根本原因。本文提出一种系统方法——概念反事实解释(CCE),以人类可理解的概念(例如,这只斑马因条纹模糊而被误分类为狗)来解释分类器在特定测试样本上犯错的原因。我们将CCE建立在两个已有思想之上:反事实解释和概念激活向量,并在知名预训练模型上验证了我们的方法,表明其能对模型错误给出有意义的解释。此外,对于在具有虚假关联的数据上训练的新模型,CCE能从单个误分类测试样本中准确识别虚假关联作为模型错误的成因。在两个具有挑战性的医疗应用中,CCE生成了有用的见解,并经临床医生确认,揭示了模型在真实场景中的偏差与错误。

关键词

引用

@article{arxiv.2106.12723,
  title  = {Meaningfully Debugging Model Mistakes using Conceptual Counterfactual Explanations},
  author = {Abubakar Abid and Mert Yuksekgonul and James Zou},
  journal= {arXiv preprint arXiv:2106.12723},
  year   = {2022}
}

备注

ICML 2022