数据选择中,Data Shapley是否不如随机?——请NASH
机器学习
2026-05-13 v2 人工智能
摘要
数据选择研究识别高质量训练数据子集的问题。虽然一些已有工作考虑以Data Shapley或其他semivalues选取具有最高-的数据子集,因为它们考虑了每个数据子集之间的相互作用,但其他工作则认为Data Shapley在实际中有时表现不佳,选出的子集不如随机。 这引出了两个问题:(I)是否存在某些"Shapley信息丰富"的情形下,Data Shapley能持续表现良好?(II)能否利用这些情形来一致且高效地选取高质量子集?本文提出了一种新型数据选择框架NASH(非线性聚合SHapley-信息丰富成分),该框架(I)将目标效用函数(如验证准确率)分解为更简单的Shapley-信息丰富组件函数,通过优化(II)对这些组件进行非线性聚合来进行数据选择。我们展示了NASH在最小额外运行时间内大幅提升了Shapley/semivalue基于数据选择的有效性。
引用
@article{arxiv.2605.10684,
title = {Is Data Shapley Not Better than Random in Data Selection? Ask NASH},
author = {Xiao Tian and Jue Fan and Rachael Hwee Ling Sim and Zixuan Wang and Nancy F. Chen and Bryan Kian Hsiang Low},
journal= {arXiv preprint arXiv:2605.10684},
year = {2026}
}
备注
Accepted to the 43rd International Conference on Machine Learning (ICML-26) as a Spotlight paper