中文

数据选择中,Data Shapley是否不如随机?——请NASH

机器学习 2026-05-13 v2 人工智能

摘要

数据选择研究识别高质量训练数据子集的问题。虽然一些已有工作考虑以Data Shapley或其他semivalues选取具有最高-mm的数据子集,因为它们考虑了每个数据子集之间的相互作用,但其他工作则认为Data Shapley在实际中有时表现不佳,选出的子集不如随机。 这引出了两个问题:(I)是否存在某些"Shapley信息丰富"的情形下,Data Shapley能持续表现良好?(II)能否利用这些情形来一致且高效地选取高质量子集?本文提出了一种新型数据选择框架NASH(非线性聚合SHapley-信息丰富成分),该框架(I)将目标效用函数(如验证准确率)分解为更简单的Shapley-信息丰富组件函数,通过优化(II)对这些组件进行非线性聚合来进行数据选择。我们展示了NASH在最小额外运行时间内大幅提升了Shapley/semivalue基于数据选择的有效性。

关键词

引用

@article{arxiv.2605.10684,
  title  = {Is Data Shapley Not Better than Random in Data Selection? Ask NASH},
  author = {Xiao Tian and Jue Fan and Rachael Hwee Ling Sim and Zixuan Wang and Nancy F. Chen and Bryan Kian Hsiang Low},
  journal= {arXiv preprint arXiv:2605.10684},
  year   = {2026}
}

备注

Accepted to the 43rd International Conference on Machine Learning (ICML-26) as a Spotlight paper