LIME 框架中数据与标签偏移的研究
机器学习
2019-11-01 v1 机器学习
摘要
LIME 是一种流行的解释方法,它通过在与预测实例邻近的实例上训练可解释模型来解释黑盒预测。为生成这些实例,LIME 随机选取预测实例中非零特征的一个子集。随后,扰动后的实例被输入黑盒模型以获得其标签,这些标签用于训练可解释模型。在本研究中,我们对 LIME 输出的可解释模型在其提出该方法的最初论文所考虑的两个用例(文本分类与目标检测)上进行了系统评估。研究表明,扰动与标注阶段导致了数据偏移与标签偏移。此外,我们研究了偏移与可解释模型保真度之间的相关性,并表明在某些情况下偏移与保真度呈负相关。基于这些发现,我们认为有必要提出一种新的采样方法,以缓解 LIME 框架中的偏移问题。
引用
@article{arxiv.1910.14421,
title = {A study of data and label shift in the LIME framework},
author = {Amir Hossein Akhavan Rahnama and Henrik Boström},
journal= {arXiv preprint arXiv:1910.14421},
year = {2019}
}
备注
Accepted at the Neurip 2019 Workshop "Human-Centric Machine Learning" (poster + spotlight talk)