中文

面向数据评估的加速Shapley值近似方法

机器学习 2023-11-10 v1

摘要

数据估值已在机器学习中找到多种应用,如数据过滤、高效学习以及数据共享激励。当前最流行的数据估值方法是Shapley值。尽管因多种应用而流行,Shapley值的计算代价高昂,即便近似也是如此,因为它需要在不同数据子集上反复迭代训练模型。本文中我们表明,通过利用机器学习问题的结构特性,可以更高效地近似数据点的Shapley值。我们针对包括具有凸和非凸损失函数的随机梯度下降在内的不同学习设置,推导了近似Shapley值精度的收敛保证。我们的分析表明,事实上在数据估值背景下,在小子集上训练的模型更为重要。基于该思想,我们描述了δ-Shapley——一种仅使用小子集进行近似的策略。实验表明,该方法在保持数据的近似值与排序的同时,实现了高达9.9倍的加速。在预训练网络中,发现该方法在使用小子集进行准确评估方面带来更高效率。

关键词

引用

@article{arxiv.2311.05346,
  title  = {Accelerated Shapley Value Approximation for Data Evaluation},
  author = {Lauren Watson and Zeno Kujawa and Rayna Andreeva and Hao-Tsung Yang and Tariq Elahi and Rik Sarkar},
  journal= {arXiv preprint arXiv:2311.05346},
  year   = {2023}
}