中文

通过集体披露衡量数据估值隐含成本

计算机科学与博弈论 2025-11-18 v2

摘要

数据估值方法为每个数据点分配边际效用,这些数据点对训练机器学习模型有贡献。如果直接用作分配机制,将导致数据估值隐含的成本,即使贡献者的边际价值为零,其数据仍需被收集和评估。为更正式地描述此成本,我们引入了一个概念模型和博弈论模型——信息披露博弈,在其中,数据联盟(有时也称为数据信托)、代表贡献者的成员运行代理人,以及数据消费者(例如平台)之间进行交互。首先聚合成员数据,随后通过在差分隐私机制下添加拉普拉斯噪声的方式,数据联盟逐步释放信息。通过以数据Shapley值和多臂老虎机探索为指导的策略进行仿真,我们在 yelp 评论有用性预测任务上演示,数据估值本质上会产生显式获取成本,而数据联盟的集体披露政策改变了这种成本在成员之间的分配方式。

关键词

引用

@article{arxiv.2510.08869,
  title  = {Measuring the Hidden Cost of Data Valuation through Collective Disclosure},
  author = {Patrick Mesana and Gilles Caporossi and Sebastien Gambs},
  journal= {arXiv preprint arXiv:2510.08869},
  year   = {2025}
}