分块数据Shapley:面向机器学习的规模化数据集质量评估
机器学习
2025-08-25 v1
摘要
随着可用数据集的规模和多样性持续增长,评估数据质量对于可靠且高效的机器学习分析变得至关重要。评估数据质量的现代博弈论方法是数据Shapley概念,它量化了数据集中单个数据点的价值。现有的将NP难的Shapley计算规模化的最先进方法在应用于大规模数据集时也面临严重挑战,限制了其实际用途。在本工作中,我们提出了一种用于识别数据集高质量数据元组的数据Shapley方法——分块数据Shapley(C-DaSh)。C-DaSh可扩展地将数据集划分为可管理的块,并通过优化的子集选择和单次迭代随机梯度下降来估计每个块的贡献。该方法大幅减少了计算时间,同时保持了高质量的结果。我们在多样化的真实世界分类和回归任务上对方法进行了经验基准测试,结果表明C-DaSh在计算效率(实现80倍至2300倍的加速)和检测低质量数据区域的准确性方面均优于现有的Shapley近似方法。我们的方法支持在大型表格数据集上进行实际的数据集质量测量,兼容分类和回归流水线。
引用
@article{arxiv.2508.16255,
title = {Chunked Data Shapley: A Scalable Dataset Quality Assessment for Machine Learning},
author = {Andreas Loizou and Dimitrios Tsoumakos},
journal= {arXiv preprint arXiv:2508.16255},
year = {2025}
}