利用自适应采样算法解决数据市场环境中的预算分配与收益分配问题
机器学习
2023-06-06 v1
摘要
高质量的机器学习模型依赖于获取高质量训练数据。当数据尚不可得时,获取它们繁琐且昂贵。数据市场有助于识别有价值的训练数据:模型消费者付费训练模型,市场使用该预算识别数据并训练模型(预算分配问题),最后市场依据数据贡献补偿数据提供方(收益分配问题)。例如,一家银行可付费给数据市场以访问其他金融机构的数据来训练欺诈检测模型。补偿数据贡献者需要理解数据对模型的贡献;近期基于 Shapley 值解决该收益分配问题的努力效率低下,无法导向实用的数据市场。本文中,我们引入一种新算法,以线性时间同时解决预算分配与收益分配问题。该新算法采用自适应采样过程,从那些对模型贡献最大的提供方中选取数据。更好的数据意味着算法更频繁地访问这些提供方,更频繁的访问对应更高的补偿。此外,该算法可部署于集中式与联邦式场景,提升其适用性。我们为算法提供理论保证,表明预算被高效使用且收益分配性质类似于 Shapley 值。最后,我们进行实证评估,展示算法在实际场景及与其他基线对比下的性能。总体而言,我们认为新算法为实用数据市场的实现铺平了道路。
引用
@article{arxiv.2306.02543,
title = {Addressing Budget Allocation and Revenue Allocation in Data Market Environments Using an Adaptive Sampling Algorithm},
author = {Boxin Zhao and Boxiang Lyu and Raul Castro Fernandez and Mladen Kolar},
journal= {arXiv preprint arXiv:2306.02543},
year = {2023}
}
备注
Published on International Conference on Machine Learning (ICML) 2023