中文

KAIROS:面向可扩展的模型无关数据定价框架

机器学习 2025-07-04 v2

摘要

训练数据不仅塑造模型准确率,还影响AI资产的合规性和市场估值。然而,现有的定价方法尚不完善:基于模型的技术依赖单个拟合模型并继承其偏见,而基于算法的方法(如数据Shapley)在Web规模下需要高昂的重训练成本。最近的基于Wasserstein的模型无关方法依赖于近似,导致对排名与真实留后验(LOO)效用不够精准。我们引入KAIROS,一个可扩展且模型无关的定价框架,为每个样本分配分布式影响得分:其对经验训练分布与干净参考集之间的最大均值不等距(MMD)贡献。与Wasserstein代理不同,基于MMD的影响得分可推导出闭形式解,忠实地近似准确的LOO排名,误差仅为O(1/N2)O(1/N^2),无需重训练,并自然扩展到条件核,实现统一的标签和特征错误检测。此外,KAIROS支持高效的在线更新:当新批次大小为mm时,所有得分可在O(mN)O(mN)时间内更新,实现最高可达50倍的加速,同时不损失排名质量。实验在噪声、误标签和投毒基准测试中表明,KAIROS在准确性和运行时间方面 consistently优于基于模型、Shapley和Wasserstein的基线方法。我们提供了严格的理论保证,包括可重复排名的对称性和可解释阈值的密度分离。

关键词

引用

@article{arxiv.2506.23799,
  title  = {KAIROS: Scalable Model-Agnostic Data Valuation},
  author = {Jiongli Zhu and Parjanya Prajakta Prashant and Alex Cloninger and Babak Salimi},
  journal= {arXiv preprint arXiv:2506.23799},
  year   = {2025}
}

备注

19 pages, 9 figures