基于可微插入/删除度量感知正则化器的解释驱动训练
机器学习
2024-03-13 v3 计算机视觉与模式识别
机器学习
摘要
复杂机器学习预测器所作预测之解释的质量,常使用插入与删除度量来衡量,这些度量评估解释的可信度,即解释在多大程度上准确反映了预测器的行为。为提升可信度,我们提出插入/删除度量感知的解释驱动优化(ID-ExpO),该方法来优化可微预测器,以改善解释的插入与删除分数,同时保持其预测精度。由于原始的插入与删除度量关于解释是不可微的,无法直接用于基于梯度的优化,我们扩展了这些度量使其可微,并用以形式化基于插入与删除度量的正则化器。我们在图像与表格数据集上的实验结果表明,使用 ID-ExpO 微调的基于深度神经网络的预测器,能使流行的后验解释器生成更可信且更易解读的解释,同时保持较高的预测精度。代码见 https://github.com/yuyay/idexpo。
引用
@article{arxiv.2310.12553,
title = {Explanation-based Training with Differentiable Insertion/Deletion Metric-aware Regularizers},
author = {Yuya Yoshikawa and Tomoharu Iwata},
journal= {arXiv preprint arXiv:2310.12553},
year = {2024}
}
备注
Accepted to AISTATS 2024