中文

CERTIFAI:面向人工智能模型鲁棒性、透明性、可解释性与公平性的反事实解释

机器学习 2020-07-07 v1 机器学习

摘要

随着人工智能在社会中扮演越来越重要的角色,企业和研究人员在道德与伦理上有义务确保其机器学习模型被负责任地设计、部署和维护。这些模型需要被严格审计以考察公平性、鲁棒性、透明性和可解释性。已有多种方法分别关注这些问题,然而在模型开发过程中协同管理这些方法可能繁琐且耗时。本文引入一种统一且模型无关的方法来解决这些问题:面向人工智能模型鲁棒性、透明性、可解释性与公平性的反事实解释(CERTIFAI)。不同于该领域以往方法,CERTIFAI 是一种可应用于任何黑盒模型和任何类型输入数据的通用工具。给定模型和输入实例,CERTIFAI 使用定制遗传算法生成反事实:接近输入且改变模型预测的实例。我们展示了如何利用这些反事实来审视鲁棒性、可解释性、透明性和公平性问题。此外,我们引入 CERScore,首个黑盒模型鲁棒性分数,其性能可与能访问模型内部的方法相媲美。

关键词

引用

@article{arxiv.1905.07857,
  title  = {CERTIFAI: Counterfactual Explanations for Robustness, Transparency, Interpretability, and Fairness of Artificial Intelligence models},
  author = {Shubham Sharma and Jette Henderson and Joydeep Ghosh},
  journal= {arXiv preprint arXiv:1905.07857},
  year   = {2020}
}