中文

破解代理模型方法论:向 XAI 致敬

人工智能 2024-06-25 v1

摘要

近年来,高度复杂 AI 系统的新应用数量显著增加。算法决策系统(ADMs)是此类应用之一,AI 系统取代人类专家的决策过程。为了确保此类系统的公平性和透明性,解释性 AI(XAI)变得越来越重要。实现可解释性的一种方法是代理模型,即基于黑盒模型的输入-输出关系训练新简单机器学习模型的想法。较简单的机器学习模型可以是决策树,人们认为它对人类而言是直观可理解的。然而,关于代理模型多好地逼近黑盒并鲜有洞见。我们的主要假设是,良好的代理模型方法应该能够将此类判别性行为带到人类的注意力;在此前的研究中,我们假设代理决策树会在其第一个层级上识别此类模式。然而,在本文中,我们展示,即使被判别的子群在所有类别中其他方面相同,却未从黑盒 ADM 系统中获得单个正向决定,系统操作员仍可将该子群成员资格的问题压制到树的任意低层。我们随后概括了这一发现,以精确定位树中判别性问题被提出的层级,并展示在更现实的情境中,当判别仅发生在劣势群体的部分比例时,隐藏此类判别更为可行。我们的做法可以轻松推广到其他代理模型。

关键词

引用

@article{arxiv.2406.16626,
  title  = {Hacking a surrogate model approach to XAI},
  author = {Alexander Wilhelm and Katharina A. Zweig},
  journal= {arXiv preprint arXiv:2406.16626},
  year   = {2024}
}

备注

24 pages, 7 figures