中文

重新审视寻找有影响力样本的方法

机器学习 2021-11-09 v1 人工智能

摘要

近来提出了若干基于样本的、用于寻找测试时决策的有影响力训练样本的的可解释性方法,包括影响函数、TraceIn、表示点选择、Grad-Dot 和 Grad-Cos。通常这些方法使用 LOO 影响(Cook 距离)作为黄金标准,或使用各种启发式方法进行评价。在本文中,我们表明上述所有方法都是不稳定的,即极度敏感于初始化、训练数据的排序和批量大小。我们提出,这是文献中假设样本的影响独立于模型状态和其他样本的自然结果——并论证其并非如此。我们表明,LOO 影响和启发式方法因此是衡量基于样本的解释质量的糟糕指标,转而建议通过检测投毒攻击的能力来评估此类解释。此外,我们提供了一个简单而有效的基线来改进上述所有方法,并展示其如何在下游任务上带来非常显著的改进。

关键词

引用

@article{arxiv.2111.04683,
  title  = {Revisiting Methods for Finding Influential Examples},
  author = {Karthikeyan K and Anders Søgaard},
  journal= {arXiv preprint arXiv:2111.04683},
  year   = {2021}
}