数据交换经济学的理论基础
计算机科学与博弈论
2024-12-04 v1
摘要
机器学习系统的巨大成功在很大程度上依赖于大规模高质量数据。对数据的高需求导致许多涉及出售、交换和共享数据的范式涌现,这激励了以数据作为资产来研究经济过程。然而,数据不同于经典经济资产,后者具有有限供应,因为数据可以以零边际成本复制,这一区别引入了数据经济过程与其他资产经济过程之间的根本性差异。我们研究了一个数据作为资产的交换(阿尔戈尔-德布鲁斯)市场的类比。在此框架下,拥有数据集的代理人进行公平且自愿的数据交换,旨在实现互惠而无需货币补偿。这一框架对于寻求通过数据交换来提高其机器学习模型性能的非营利组织尤其相关,因为后者受限于出售数据获取利润。我们提出了一个通用的数据交换框架,基于两个核心原则:(i)公平性,确保每个代理人获得与其对他人贡献成正比的效用;贡献可使用像Shapley 价值这样的标准信用共享函数进行量化;(ii)稳定性,确保没有代理人联盟可以识别一种他们一致比当前交换更好的交换。我们证明了对于所有单调连续效用函数,都存在公平且稳定的交换。接下来,我们研究了寻找近似公平且稳定交换的计算复杂性。我们提出了一个局部搜索算法,用于单调亚调和效用函数的实例,其中每个代理人的贡献使用Shapley 价值进行衡量。我们证明了在轻微假设下,该问题属于 CLS。我们框架为数据经济学的多个引人入胜的理论方向打开了探索之门。
关键词
引用
@article{arxiv.2412.01968,
title = {On the Theoretical Foundations of Data Exchange Economies},
author = {Hannaneh Akrami and Bhaskar Ray Chaudhury and Jugal Garg and Aniket Murhekar},
journal= {arXiv preprint arXiv:2412.01968},
year = {2024}
}
备注
42 pages