对抗情境下事后解释未能实现其目的
机器学习
2022-05-12 v2 人工智能
摘要
现有及酝酿中的立法规定了关于提供机器学习算法及其运作信息的各类义务,常被解读为“解释”义务。许多研究者建议为此使用事后解释算法。本文结合法律、哲学与技术论证表明,事后解释算法不适于实现法律的目标。事实上,大多数请求解释的情形是对抗性的,即解释提供方与接收方利益与激励相左,从而提供方可能为其自身目的操纵解释。我们表明,由于现实应用场景中事后解释的高度模糊性,这一根本冲突无法化解。因此,事后解释算法不适于实现法律规范的透明度目标。相反,需要更明确地讨论“可解释性”义务背后的目标,因为这些目标往往可通过其他机制更好地达成。鉴于当前欧盟《人工智能法案》草案的谈判,亟需就对抗情境下事后解释的潜力与局限展开更开放、诚实的讨论。
引用
@article{arxiv.2201.10295,
title = {Post-Hoc Explanations Fail to Achieve their Purpose in Adversarial Contexts},
author = {Sebastian Bordt and Michèle Finck and Eric Raidl and Ulrike von Luxburg},
journal= {arXiv preprint arXiv:2201.10295},
year = {2022}
}
备注
FAccT 2022