中文

面向大型语言模型数据共享的DSIC机制设计

计算机科学与博弈论 2025-06-09 v1 人工智能 计算机与社会

摘要

训练大型语言模型(LLM)需要来自面临法律、隐私和战略约束的机构的大量高质量数据。现有的数据采购方法常依赖不可验证的信任,或忽视供应商的异构成本。我们引入一种机制设计框架,用于可信赖的数据共享,确保占主导策略的激励兼容性(DSIC)、个人理性以及弱预算平衡,同时根据数据质量和学习效用对数据进行奖励。我们形式化了一个模型,其中供应商私下知道其数据的成本和质量,价值仅源于数据对模型性能的贡献。基于此,我们提出了质量加权边际激励拍卖(Q-MIA),该拍卖使用虚拟成本指标对供应商进行排序,并采用Myerson风格的付款确保DSIC和预算可行性。为支持流动性有限或长期激励的场景,我们引入了边际效用代币(MUT),其根据边际贡献分配未来权利。我们将这些统一在混合MIA(Mixed-MIA)中,这是一种平衡 upfront 付款和 deferred 奖励的混合机制。所有机制都支持可验证、隐私保护的实现。理论上和实证上,它们优于基于体积和信任的基线,能够在预算约束下激发更高质量的数据,同时对误报和串通作出鲁健性反应。这为未来大型语言模型的可持续和公平数据市场奠定了原则性基础。

关键词

引用

@article{arxiv.2506.05379,
  title  = {Designing DSIC Mechanisms for Data Sharing in the Era of Large Language Models},
  author = {Seyed Moein Ayyoubzadeh and Kourosh Shahnazari and Mohammmadali Keshtparvar and MohammadAmin Fazli},
  journal= {arXiv preprint arXiv:2506.05379},
  year   = {2025}
}