Data Shapley:面向机器学习的数据公平估值
机器学习
2019-06-11 v2 人工智能
机器学习
摘要
随着数据成为驱动技术与经济增长的燃料,一个根本挑战是如何量化数据在算法预测与决策中的价值。例如,在医疗健康和消费市场中,有人建议应补偿个人所生成的数据,但尚不清楚对个体数据的公平估值是什么。本工作中,我们开发了一个原则性框架,以在有监督机器学习的背景下解决数据估值问题。给定在 个数据点上进行训练以产生预测器的学习算法,我们提出 data Shapley 作为一种度量,以量化每个训练数据对预测器性能的价值。Data Shapley 值唯一地满足公平数据估值的若干自然性质。我们开发了蒙特卡洛和基于梯度的方法,以在复杂学习算法(包括神经网络)在大型数据集上训练的实际场景中高效估计 data Shapley 值。除了公平性之外,在生物医学、图像和合成数据上的大量实验表明 data Shapley 还具有若干其他益处:1)在提供关于哪些数据对给定学习任务更有价值的洞察方面,它比流行的留一法或杠杆得分更强大;2)低 Shapley 值数据有效捕获异常值与损坏;3)高 Shapley 值数据指示应获取何种类型的新数据以改进预测器。
引用
@article{arxiv.1904.02868,
title = {Data Shapley: Equitable Valuation of Data for Machine Learning},
author = {Amirata Ghorbani and James Zou},
journal= {arXiv preprint arXiv:1904.02868},
year = {2019}
}