中文

在贝叶斯学习中激励真实性与协作公平性

机器学习 2026-05-13 v1 人工智能

摘要

协作机器学习涉及使用来自多个来源的数据集训练高质量模型。为了激励数据源分享数据,现有的数据估值方法根据其提交的原始数据公平地奖励每个来源。然而,由于这些方法既不验证也不激励数据真实性,数据源可以操纵其数据(例如,通过提交重复或噪声数据)来人为地提高其估值和奖励,或阻止他人受益。本文提出了首个机制,该机制在贝叶斯模型上可证明地确保(F)协作公平性并在均衡状态下激励(T)真实性。我们的机制结合了确保公平性的半值(如 Shapley 值)和一个基于数据源未知的验证集的真实数据估值函数(DVF)。由于半值受他人数据影响,我们引入了一个附加条件来证明,一个数据源可以通过提交捕捉其真实知识的数据集来最大化其在联盟和半值中的预期数据价值。此外,我们讨论了当调解者奖励预算有限或缺乏验证集时,(F)和(T)的含义及适当的松弛条件。我们的理论发现已在合成和真实世界数据集上得到验证。

关键词

引用

@article{arxiv.2605.11889,
  title  = {Incentivizing Truthfulness and Collaborative Fairness in Bayesian Learning},
  author = {Rachael Hwee Ling Sim and Jue Fan and Xiao Tian and Xinyi Xu and Patrick Jaillet and Bryan Kian Hsiang Low},
  journal= {arXiv preprint arXiv:2605.11889},
  year   = {2026}
}

备注

Accepted to the 43rd International Conference on Machine Learning (ICML-26) as a Spotlight paper