中文

CoLa-DCE——概念引导的潜在扩散反事实解释

机器学习 2024-06-05 v1 人工智能 统计方法学

摘要

生成式AI的最新进展带来了新的前景和实际应用。特别是扩散模型在生成多样且同时逼真的特征方面显示出其优势,使其非常适合为计算机视觉模型生成反事实解释。回答“如果……会怎样”的问题,即需要改变什么才能使图像分类器改变其预测,反事实解释与人类理解高度一致,从而有助于使模型行为更易于理解。当前的方法成功生成了真实的反事实,但缺乏透明度,因为特征变化不是直接可感知的。为了解决这一局限性,我们引入了概念引导的潜在扩散反事实解释(CoLa-DCE)。CoLa-DCE为任何分类器生成概念引导的反事实,对概念选择和空间条件具有高度控制。反事实通过最小的特征变化包含更高的粒度。参考特征可视化确保了更好的可理解性,而特征定位提供了“在哪里”改变了“什么”的更高透明度。我们在多个图像分类模型和数据集上展示了我们的方法在最小性和可理解性方面的优势,并提供了关于CoLa-DCE解释如何帮助理解模型错误(如误分类情况)的见解。

关键词

引用

@article{arxiv.2406.01649,
  title  = {CoLa-DCE -- Concept-guided Latent Diffusion Counterfactual Explanations},
  author = {Franz Motzkus and Christian Hellert and Ute Schmid},
  journal= {arXiv preprint arXiv:2406.01649},
  year   = {2024}
}