中文

可扩展性与效用性:在数据重要性量化中我们是否必须二者取一?

机器学习 2021-04-27 v2 机器学习

摘要

量化每个训练点对学习任务的重要性是机器学习中的基本问题,且估计的重要性分数已被用于指导一系列数据工作流,如数据摘要与域适应。一个简单的想法是用每个训练点的留一误差来指示其重要性。近期工作也提出使用 Shapley 值,因为它定义了一种满足一组吸引人性质的唯一价值分配方案。然而,计算 Shapley 值通常开销很大,限制了其在大规模实际应用中的适用性。近来提出了多种启发式方法以提升 Shapley 值计算的可扩展性,但存在损害其在实际应用中效用性的潜在风险。现有数据量化方法在已有工作流上表现如何?这些方法在经验与理论上相互比较结果怎样?使用这些方法时是否必须在这些工作流的可扩展性与效用性之间牺牲其一?本文中,我们进行了新颖的理论分析以比较不同重要性量化方法的效用性,并报告了在已有及提出的工作流(如噪声标签检测、水印去除、数据摘要、数据获取与域适应)上的广泛实验研究。我们展示了基于预训练特征嵌入上 KKNN 代理的 Shapley 值近似在获得与现有算法相当效用性的同时实现了显著的可扩展性提升,常达数个数量级。我们的理论分析也论证了其相对于留一误差的优势。代码见 \url{https://github.com/AI-secure/Shapley-Study}。

关键词

引用

@article{arxiv.1911.07128,
  title  = {Scalability vs. Utility: Do We Have to Sacrifice One for the Other in Data Importance Quantification?},
  author = {Ruoxi Jia and Fan Wu and Xuehui Sun and Jiacen Xu and David Dao and Bhavya Kailkhura and Ce Zhang and Bo Li and Dawn Song},
  journal= {arXiv preprint arXiv:1911.07128},
  year   = {2021}
}