通过重标签蒸馏解释深度网络的预测
计算机视觉与模式识别
2024-09-23 v1 人工智能
密码学与安全
摘要
解释黑盒深度网络的预测有助于提高其部署的可靠性。在本工作中,我们提出了一种重标签蒸馏方法,以自监督的方式学习从输入到预测的直接映射。图像被投影到 VAE 子空间中,通过随机扰动其隐向量来生成一些合成图像。然后,通过识别这些合成图像的标签是否发生偏移,将其标注为两类中的一类。此后,以深度网络标注的标签作为教师,训练一个线性学生模型,通过将这些合成图像映射到相应类别来近似这些标注。通过这种方式,这些重标签的合成图像能够很好地描述深度网络的局部分类机制,并且学习到的学生模型能够为预测提供更直观的解释。大量实验定性和定量地验证了我们方法的有效性。
引用
@article{arxiv.2409.13137,
title = {Interpret the Predictions of Deep Networks via Re-Label Distillation},
author = {Yingying Hua and Shiming Ge and Daichi Zhang},
journal= {arXiv preprint arXiv:2409.13137},
year = {2024}
}
备注
Published by IEEE ICME 2021