RelatIF:通过相对影响识别解释性训练样本
机器学习
2020-03-27 v1 机器学习
摘要
在这项工作中,我们关注使用影响函数(influence functions)来识别相关的训练样本,人们可能希望这些样本能够“解释”机器学习模型的预测。影响函数的一个缺陷是,被认为最具“影响力”的训练样本往往是离群值或错误标注样本,这使得它们不适合作为解释。为解决这一缺陷,我们区分了全局影响与局部影响的作用。我们引入RelatIF,一类通过优化目标来选择相关训练样本的新准则,该目标对全局影响施加约束。RelatIF考虑解释性样本对预测的局部影响相对于其对模型的全局效应。在实证评估中,我们发现RelatIF返回的样本比使用影响函数找到的样本更直观。
引用
@article{arxiv.2003.11630,
title = {RelatIF: Identifying Explanatory Training Examples via Relative Influence},
author = {Elnaz Barshan and Marc-Etienne Brunet and Gintare Karolina Dziugaite},
journal= {arXiv preprint arXiv:2003.11630},
year = {2020}
}