中文

通过重标签蒸馏解释深度网络的预测

计算机视觉与模式识别 2024-09-23 v1 人工智能 密码学与安全

摘要

解释黑盒深度网络的预测有助于提高其部署的可靠性。在本工作中,我们提出了一种重标签蒸馏方法,以自监督的方式学习从输入到预测的直接映射。图像被投影到 VAE 子空间中,通过随机扰动其隐向量来生成一些合成图像。然后,通过识别这些合成图像的标签是否发生偏移,将其标注为两类中的一类。此后,以深度网络标注的标签作为教师,训练一个线性学生模型,通过将这些合成图像映射到相应类别来近似这些标注。通过这种方式,这些重标签的合成图像能够很好地描述深度网络的局部分类机制,并且学习到的学生模型能够为预测提供更直观的解释。大量实验定性和定量地验证了我们方法的有效性。

关键词

引用

@article{arxiv.2409.13137,
  title  = {Interpret the Predictions of Deep Networks via Re-Label Distillation},
  author = {Yingying Hua and Shiming Ge and Daichi Zhang},
  journal= {arXiv preprint arXiv:2409.13137},
  year   = {2024}
}

备注

Published by IEEE ICME 2021