利用特征重要性融合提升安全关键系统中机器学习输出解释的可靠性
机器学习
2020-09-14 v1 机器学习
摘要
当机器学习在安全关键系统中辅助决策时,核实并理解产生特定输出的原因十分重要。尽管特征重要性计算方法有助于解释,但关于如何量化特征重要性的共识缺失,使得为结果提供的解释大多不可靠。解决这一分歧的一种可能方案是结合多个特征重要性量化器的的结果以减小估计方差。我们的假设是,这将带来对每特征之于机器学习预测贡献的更稳健且可信的解释。为辅助验证该假设,我们提出一个可扩展框架,分为四个主要部分:(i) 面向预测性机器学习模型的传统数据预处理与准备;(ii) 预测性机器学习;(iii) 特征重要性量化;(iv) 使用集成策略的特征重要性决策融合。我们还引入了一种新的融合度量,并与最先进水平进行比较。我们的方法在已知真值的人工数据上测试。我们比较了不同的融合方法及其在训练集和测试集上的结果。我们还研究了数据集中不同特征如何影响所考察的特征重要性集成。结果表明,我们的特征重要性集成框架相比现有方法总体产生少 15% 的特征重要性误差。此外,结果揭示数据集中不同噪声水平不影响特征重要性集成准确量化特征重要性的能力,而特征重要性量化误差随特征数量与正交可解释特征数量的增加而增大。
引用
@article{arxiv.2009.05501,
title = {Towards a More Reliable Interpretation of Machine Learning Outputs for Safety-Critical Systems using Feature Importance Fusion},
author = {Divish Rengasamy and Benjamin Rothwell and Grazziela Figueredo},
journal= {arXiv preprint arXiv:2009.05501},
year = {2020}
}