中文

从点到联盟:用于数据样本优先排序的分层对比沙普利值

机器学习 2025-12-23 v1

摘要

当数据集庞大、异构且具有几何结构时,我们应如何量化每个训练样本的价值?经典的数据沙普利值在原则上提供了答案,但其 O(n!)O(n!) 的复杂度和逐点视角不适合现代规模。我们提出了分层对比数据估值(HCDV),这是一个三阶段框架:(i)学习一个对比的、保持几何结构的表示,(ii)将数据组织成一个平衡的从粗到细的聚类层次结构,以及(iii)通过局部蒙特卡洛博弈为联盟分配沙普利式收益,其预算向下传播。HCDV将阶乘负担降低到 O(TlKl)=O(TKmaxlogn)O(T \sum_{l} K_{l}) = O(T K_{\max} \log n),奖励那些锐化决策边界的样本,并通过基于曲率的平滑性正则化异常值。我们证明HCDV近似满足沙普利四条公理,剩余损失为 O(ηlogn)O(\eta \log n),享有次高斯联盟偏差 O~(1/T)\tilde{O}(1/\sqrt{T}),并且对于top-k选择最多产生 kϵk \epsilon_{\infty} 的遗憾。在四个基准测试(表格、视觉、流式和一个4500万样本的CTR任务)以及OpenDataVal套件上的实验表明,HCDV将准确率提升了高达5个百分点,将估值时间削减了高达100倍,并直接支持诸如增强过滤、低延迟流式更新和公平市场支付等任务。

关键词

引用

@article{arxiv.2512.19363,
  title  = {From Points to Coalitions: Hierarchical Contrastive Shapley Values for Prioritizing Data Samples},
  author = {Canran Xiao and Jiabao Dou and Zhiming Lin and Zong Ke and Liwei Hou},
  journal= {arXiv preprint arXiv:2512.19363},
  year   = {2025}
}

备注

AAAI'26 Oral