反事实解释与主因解释背后的隐藏假设
计算机与社会
2019-12-12 v1
摘要
反事实解释作为一种解释机器学习模型决策的方式,在技术、法律与商业圈中日益受到重视。这些解释与美国信贷法律长期要求的“主因(principal reason)”解释有一个共同特征:它们都通过突出一组被认为最相关的特征并隐去其他特征来解释一项决策。这些“特征突出型解释”具有若干可取性质:它们对模型复杂度无约束、不要求披露模型、详述了达成不同决策所需改变的内容,且似乎能自动化实现法律合规。但它们远比表面看起来复杂且主观。在本文中,我们论证了特征突出型解释的效用依赖于若干易被忽视的假设:所推荐的特征值改变能清晰映射到现实世界行动、仅通过考察训练数据分布即可使特征具有可比性、特征仅与手头决策相关、以及底层模型随时间稳定、单调且限于二元结果。随后我们探讨了承认并试图应对这些假设所带来的若干后果,包括特征突出型解释在旨在尊重自主性方面的悖论、其所赋予决策者的不受制约的权力,以及使这些解释有用与需隐藏模型之间的张力。尽管新研究提出了若干使特征突出型解释规避我们所指出部分问题的方法,但在模型中的特征与现实世界行动之间的脱节——以及弥补此脱节所必需的主观选择——必须被理解,这些技术才能被有效实施。
引用
@article{arxiv.1912.04930,
title = {The Hidden Assumptions Behind Counterfactual Explanations and Principal Reasons},
author = {Solon Barocas and Andrew D. Selbst and Manish Raghavan},
journal= {arXiv preprint arXiv:1912.04930},
year = {2019}
}