用于反事实解释的文生图模型:一种黑盒方法
计算机视觉与模式识别
2023-11-16 v2
摘要
本文解决了生成反事实解释(CEs)的挑战,包括识别并修改最少数量的必要特征以改变分类器对给定图像的预测。我们提出的方法,用于反事实解释的文生图模型(TIME),是一种基于蒸馏的黑盒反事实技术。与先前方法不同,该方法仅需要图像及其预测,无需分类器的结构、参数或梯度。在生成反事实之前,TIME以文本嵌入的形式将两种不同偏置引入Stable Diffusion:与图像结构相关的上下文偏置,以及与目标分类器学到的类特定特征相关的类偏置。在学习这些偏置后,我们应用分类器预测的类令牌找到最优潜码,并使用目标嵌入作为条件重新生成图像,从而产生反事实解释。大量实证研究表明,即使在黑盒设置下运行,TIME也能生成有效性相当的解释。
引用
@article{arxiv.2309.07944,
title = {Text-to-Image Models for Counterfactual Explanations: a Black-Box Approach},
author = {Guillaume Jeanneret and Loïc Simon and Frédéric Jurie},
journal= {arXiv preprint arXiv:2309.07944},
year = {2023}
}
备注
WACV 2024 Camera ready + supplementary material