可解释的基于特征重要性的全局误差加权:用于评估数据插补与数据增强误差的 xGEWFI 指标
机器学习
2022-06-22 v1
摘要
评估算法的性能至关重要。评估数据插补与数据增强的性能可以类似,因为两者生成的数据均可与原始分布进行比较。然而,典型的评估指标存在相同缺陷:它们在计算生成数据的特征误差和全局误差时,未将误差与特征重要性进行加权。若所有特征的重要性相近,结果可能良好。然而,在大多数情况下,特征的重要性是不平衡的,这可能会在特征误差和全局误差上引入显著的偏差。本文提出了一种名为“可解释的基于特征重要性的全局误差加权”(xGEWFI)的新指标。该新指标在一个完整的预处理方法中进行了测试,该方法:1. 检测异常值并将其替换为空值;2. 插补缺失数据;3. 增强数据。在该过程结束时,计算 xGEWFI 误差。使用 Kolmogorov-Smirnov 检验(KS 检验)对每个特征计算原始数据与生成数据之间的分布误差。将这些结果乘以使用随机森林(RF)算法计算出的相应特征的重要性。该指标的结果以可解释的格式表达,旨在实现合乎伦理的 AI。
引用
@article{arxiv.2206.08980,
title = {Explainable Global Error Weighted on Feature Importance: The xGEWFI metric to evaluate the error of data imputation and data augmentation},
author = {Jean-Sébastien Dessureault and Daniel Massicotte},
journal= {arXiv preprint arXiv:2206.08980},
year = {2022}
}