论 KNN-Shapley 值的膨胀
机器学习
2024-05-29 v1 人工智能
摘要
基于 Shapley 值的数据估值方法源于合作博弈论,通过考虑每个样本对所有可能训练子集的贡献来量化其有用性。尽管应用广泛,这些方法仍面临价值膨胀的挑战——虽然具有负 Shapley 值的样本是有害的,但一些具有正值的样本也可能是有害的。这一挑战引发了两个基本问题:将零作为区分有害和有益样本的阈值的适宜性,以及如何确定一个合适的阈值。为了解决这些问题,我们聚焦于 KNN-Shapley,并提出了校准的 KNN-Shapley(CKNN-Shapley),它通过减轻小规模训练子集的负面影响,将零校准为区分有害样本和有益样本的阈值。通过广泛的实验,我们证明了 CKNN-Shapley 在缓解数据估值膨胀、检测有害样本和评估数据质量方面的有效性。我们还将我们的方法扩展到常规分类设置之外,将其应用于多样且实用的场景,如带误标签数据的学习、流数据在线学习以及用于标签标注的主动学习。
关键词
引用
@article{arxiv.2405.17489,
title = {On the Inflation of KNN-Shapley Value},
author = {Ziao Yang and Han Yue and Jian Chen and Hongfu Liu},
journal= {arXiv preprint arXiv:2405.17489},
year = {2024}
}