语义与解释:为何反事实解释在深度神经网络中产生对抗样本
人工智能
2020-12-21 v1 计算机与社会
机器学习
摘要
可解释AI近期论文为反事实解释模式提供了有力论证。尽管反事实解释在某些情形下似乎极为有效,但它们在形式上等价于对抗样本。这给可解释性研究者带来一个明显悖论:若这两种过程形式等价,何种原因导致了反事实解释与对抗样本之间明显的解释性分歧?我们通过重新强调反事实表达的语义来解决此悖论。为深度学习的系统提供令人满意的解释,将要求我们找到解释深度神经网络隐藏层表示语义的方法。
引用
@article{arxiv.2012.10076,
title = {Semantics and explanation: why counterfactual explanations produce adversarial examples in deep neural networks},
author = {Kieran Browne and Ben Swift},
journal= {arXiv preprint arXiv:2012.10076},
year = {2020}
}