使用 Softmax 前分数的归因方法的一个漏洞
机器学习
2024-04-10 v3 人工智能
摘要
我们讨论了一类用于为作为分类器的卷积神经网络输出提供解释的归因方法所涉及的一个漏洞。已知此类网络易受对抗攻击,即输入的难以察觉的扰动可能改变模型输出。相反,此处我们关注模型中的微小修改可在不改变模型输出的情况下对归因方法造成的影响。
引用
@article{arxiv.2307.03305,
title = {A Vulnerability of Attribution Methods Using Pre-Softmax Scores},
author = {Miguel Lerma and Mirtha Lucas},
journal= {arXiv preprint arXiv:2307.03305},
year = {2024}
}
备注
7 pages, 5 figures