中文

语义与解释:为何反事实解释在深度神经网络中产生对抗样本

人工智能 2020-12-21 v1 计算机与社会 机器学习

摘要

可解释AI近期论文为反事实解释模式提供了有力论证。尽管反事实解释在某些情形下似乎极为有效,但它们在形式上等价于对抗样本。这给可解释性研究者带来一个明显悖论:若这两种过程形式等价,何种原因导致了反事实解释与对抗样本之间明显的解释性分歧?我们通过重新强调反事实表达的语义来解决此悖论。为深度学习的系统提供令人满意的解释,将要求我们找到解释深度神经网络隐藏层表示语义的方法。

关键词

引用

@article{arxiv.2012.10076,
  title  = {Semantics and explanation: why counterfactual explanations produce adversarial examples in deep neural networks},
  author = {Kieran Browne and Ben Swift},
  journal= {arXiv preprint arXiv:2012.10076},
  year   = {2020}
}