面向行为与文本数据的反事实解释算法
人工智能
2021-07-01 v1
摘要
我们研究使用高维行为与文本数据的预测系统的可解释性。例子包括基于在线浏览数据预测产品兴趣,以及检测垃圾邮件或不良网络内容。近来,反事实解释被提出用于生成对模型预测的洞察,其关注与特定实例相关的因素。由于维度巨大,为计算反事实而进行完备搜索非常耗时。据我们所知,针对行为与文本数据,文献中仅提出了一种寻找反事实解释的模型无关启发式算法(SEDC)。然而,可能存在更优的快速寻找反事实的算法。本研究将最近提出的线性可解释模型无关解释器(LIME)与Shapley加性解释(SHAP)与反事实解释的概念相对齐,并使用13个数据集实证基准了它们相对于SEDC的有效性与效率。结果表明,LIME-反事实(LIME-C)与SHAP-反事实(SHAP-C)计算时间低且稳定,但在多数情况下效率不如SEDC。然而,对于某些数据集上的特定实例,SEDC的运行时间相当大。在有效性方面,LIME-C与SHAP-C能找到合理(即便不总是最优)的反事实解释。不过,SHAP-C似乎在高度不平衡数据上遇到困难。由于其良好的整体表现,LIME-C似乎是SEDC的有利替代方案,后者因其特定的启发式搜索算法,在某些非线性模型上未能找到反事实。本文的一个主要结论是,仍有大量空间供进一步研究。例如,我们提出了作为本文发现直接结果的算法调整建议。
引用
@article{arxiv.1912.01819,
title = {Counterfactual Explanation Algorithms for Behavioral and Textual Data},
author = {Yanou Ramon and David Martens and Foster Provost and Theodoros Evgeniou},
journal= {arXiv preprint arXiv:1912.01819},
year = {2021}
}
备注
24 pages, 7 figures, currently under review