中文

基于解释的反事实重训练(XCR):一种黑盒模型的校准方法

机器学习 2022-06-23 v1

摘要

随着可解释人工智能(XAI)的快速发展,大量以往工作关注基于扰动的因果后验XAI模型中的分布外(OOD)问题,以及解释在社会层面的错位。我们探讨了使用后验解释方法、利用近似器来模仿黑盒模型行为的局限性。随后我们提出基于解释的反事实重训练(XCR),可快速提取特征重要性。XCR将XAI模型生成的解释作为反事实输入,对黑盒模型进行重训练,以解决OOD和社会错位问题。在流行图像数据集上的评估表明,XCR仅保留12.5%最关键特征且不改变黑盒模型结构的情况下,即可提升模型性能。此外,在损坏数据集基准上的评估表明,XCR非常有助于提升模型鲁棒性,并对OOD问题的校准产生积极影响。尽管不像某些OOD校准方法那样在验证集上校准,其损坏数据指标仍优于现有方法。若在验证集上应用校准,我们的方法在OOD校准指标上也击败了当前的OOD校准方法。

关键词

引用

@article{arxiv.2206.11126,
  title  = {Explanation-based Counterfactual Retraining(XCR): A Calibration Method for Black-box Models},
  author = {Liu Zhendong and Wenyu Jiang and Yi Zhang and Chongjun Wang},
  journal= {arXiv preprint arXiv:2206.11126},
  year   = {2022}
}

备注

Submitted for ECML-PKDD 2022 but not accepted