中文

可解释机器学习科学研究中的合成基准

机器学习 2021-11-08 v4 人工智能 机器学习

摘要

随着机器学习模型日益复杂且应用风险日益增高,解释模型预测的工具变得愈发重要。这催生了大量模型可解释性研究,并产生了诸如 LIME 与 SHAP 等特征归因方法。尽管这些方法被广泛使用,评估和比较不同特征归因方法仍具挑战性:评估理想情况下需人类研究,且经验评估指标在真实数据集上往往数据密集或计算昂贵。本文中,我们通过发布 XAI-Bench 解决此问题:一套合成数据集及用于基准测试特征归因算法的库。与真实数据集不同,合成数据集可高效计算评估真值 Shapley 值及其他指标所需的条件期望值。我们发布的合成数据集提供可配置以模拟真实数据的广泛参数。我们通过在多种评估指标与设置下对流行可解释性技术进行基准测试,展示了库的能力。我们库的通用性与高效性将助力研究者将其可解释性方法从开发推向部署。我们的代码见 https://github.com/abacusai/xai-bench。

关键词

引用

@article{arxiv.2106.12543,
  title  = {Synthetic Benchmarks for Scientific Research in Explainable Machine Learning},
  author = {Yang Liu and Sujay Khandagale and Colin White and Willie Neiswanger},
  journal= {arXiv preprint arXiv:2106.12543},
  year   = {2021}
}

备注

NeurIPS Datasets and Benchmarks Track 2021