中文

通过随机实验度量训练数据对深度学习预测的影响

机器学习 2022-06-22 v1

摘要

我们提出了一种新颖且基于原理的算法,用于估计训练数据点对深度学习模型行为(例如其做出的特定预测)的贡献。我们的算法估计 AME,即度量将一个数据点添加到从给定分布中采样的训练数据子集时的期望(平均)边际效应的量。当子集从均匀分布中采样时,AME 退化为众所周知的 Shapley 值。我们的方法受因果推断与随机实验启发:我们采样训练数据的不同子集以训练多个子模型,并评估每个子模型的行为。随后,我们基于子集构成,使用 LASSO 回归联合估计每个数据点的 AME。在稀疏性假设下(具有较大 AME 的数据点 kNk \ll N),我们的估计器仅需 O(klogN)O(k\log N) 次随机子模型训练,优于最佳的先前 Shapley 值估计器。

关键词

引用

@article{arxiv.2206.10013,
  title  = {Measuring the Effect of Training Data on Deep Learning Predictions via Randomized Experiments},
  author = {Jinkun Lin and Anqi Zhang and Mathias Lecuyer and Jinyang Li and Aurojit Panda and Siddhartha Sen},
  journal= {arXiv preprint arXiv:2206.10013},
  year   = {2022}
}

备注

ICML 2022