失去才懂珍惜:基于机器遗忘与Shapley值的数据估值
人工智能
2025-09-24 v2 机器学习
摘要
大模型的激增加剧了对高效数据估值方法的需求,以量化个体数据提供者的贡献。传统方法,如基于博弈论的 Shapley 值和基于影响函数的技术,面临高昂的计算成本或需要访问完整数据和模型训练细节,这使得它们难以实现部分数据估值。为解决这一问题,我们提出了 Unlearning Shapley,一个利用机器遗忘来高效估计数据价值的新颖框架。通过从预训练模型中遗忘目标数据并测量在可达测试集上的性能变化,我们的方法通过蒙特卡洛采样计算 Shapley 值,避免了重新训练并消除了对完整数据的依赖。至关重要的是,Unlearning Shapley 同时支持完整和部分数据估值,使其可扩展至大模型(如 LLM),并适用于数据市场。在基准数据集和大规模文本语料库上的实验表明,我们的方法在匹配最先进方法准确性的同时,将计算开销降低了数个数量级。进一步的分析证实了估计值与数据子集真实影响之间的强相关性,验证了其在现实场景中的可靠性。这项工作弥合了数据估值理论与实践部署之间的差距,为现代人工智能生态系统提供了一种可扩展且符合隐私要求的解决方案。
引用
@article{arxiv.2505.16147,
title = {Losing is for Cherishing: Data Valuation Based on Machine Unlearning and Shapley Value},
author = {Le Ma and Shirao Yang and Zihao Wang and Yinggui Wang and Lei Wang and Tao Wei and Kejun Zhang},
journal= {arXiv preprint arXiv:2505.16147},
year = {2025}
}
备注
There are theoretical mistakes in Section 3.2, where the definition of utility should be fixed. Therefore, this paper requires a major revision in its methodology