借助反事实知识蒸馏修正Clever-Hans预测器
人工智能
2023-10-05 v2
摘要
本文引入一种称为反事实知识蒸馏(CFKD)的新技术,借助人类专家反馈来检测并消除深度学习模型对混杂因子的依赖。混杂因子是模型倾向于依赖的伪特征,可能导致在受监管或安全关键领域出现意外错误。本文强调了CFKD在此类领域的益处,并展示了反事实解释相对于其他类型解释的一些优势。我们提出了一种实验方案,以定量评估CFKD的成功以及能够向模型提供反馈的不同教师模型。我们还引入了一种与真实测试性能相关性优于验证准确率的新指标。本文在合成增强数据集和真实世界组织病理学数据集上展示了CFKD的有效性。
引用
@article{arxiv.2310.01011,
title = {Towards Fixing Clever-Hans Predictors with Counterfactual Knowledge Distillation},
author = {Sidney Bender and Christopher J. Anders and Pattarawatt Chormai and Heike Marxfeld and Jan Herrmann and Grégoire Montavon},
journal= {arXiv preprint arXiv:2310.01011},
year = {2023}
}