中文

Beta Shapley:一种统一且降噪的机器学习数据估值框架

机器学习 2022-01-20 v2 机器学习

摘要

Data Shapley 近来被提出作为一种原则性框架,用于量化机器学习中单个数据点的贡献。它能有效识别对学习算法有帮助或有害的数据点。本文中,我们提出 Beta Shapley,它是 Data Shapley 的实质推广。Beta Shapley 通过放宽 Shapley 值的效率公理自然产生,该公理在机器学习场景中并非关键。Beta Shapley 统一了若干流行的数据估值方法,并将 Data Shapley 作为特例包含在内。此外,我们证明 Beta Shapley 具有若干理想的统计性质,并提出高效算法对其进行估计。我们展示 Beta Shapley 在若干下游 ML 任务上优于最先进的数据估值方法,例如:1) 检测误标注训练数据;2) 使用子样本学习;3) 识别其添加或移除对模型具有最大正向或负向影响的点。

关键词

引用

@article{arxiv.2110.14049,
  title  = {Beta Shapley: a Unified and Noise-reduced Data Valuation Framework for Machine Learning},
  author = {Yongchan Kwon and James Zou},
  journal= {arXiv preprint arXiv:2110.14049},
  year   = {2022}
}

备注

24 pages, AISTATS 2022 Oral