中文

通过合成数据奖励激励机器学习中的协作

机器学习 2021-12-20 v1

摘要

本文提出了一种新颖的协作生成建模(CGM)框架,该框架激励自利方之间协作,将数据贡献到一个池中用于训练生成模型(例如 GAN),从中抽取合成数据并作为与其贡献相称的奖励分配给各方。将合成数据作为奖励分配(而非训练好的模型或金钱)为下游学习任务提供了与任务和模型无关的益处,并且不太可能违反数据隐私法规。为实现该框架,我们首先提出一种使用最大均值差异(MMD)的数据估值函数,该函数根据数据在接近真实数据分布方面的数量和质量来估值数据,并给出指导我们基于 MMD 的数据估值函数中核选择的理论结果。然后,我们将奖励方案表述为一个线性优化问题,求解该问题可保证 CGM 框架中的某些激励如公平性。我们设计了一种加权采样算法用于生成合成数据并作为奖励分配给各方,使得其数据与合成数据的组合价值与其由奖励方案分配的奖励值相匹配。我们使用模拟和真实世界数据集实证表明,各方的合成数据奖励与其贡献相称。

关键词

引用

@article{arxiv.2112.09327,
  title  = {Incentivizing Collaboration in Machine Learning via Synthetic Data Rewards},
  author = {Sebastian Shenghong Tay and Xinyi Xu and Chuan Sheng Foo and Bryan Kian Hsiang Low},
  journal= {arXiv preprint arXiv:2112.09327},
  year   = {2021}
}

备注

36th AAAI Conference on Artificial Intelligence (AAAI 2022), Extended version with derivations, 42 pages