CS-Shapley:用于分类中数据估值的类-wise Shapley 值
机器学习
2022-11-15 v1
摘要
数据估值,即个体数据贡献的估值,因其在噪声标签检测等任务中已证实的有效性,在机器学习中受到日益增长关注。特别地,由于可取的公理性质,已有若干 Shapley 值近似方法被提出。这些方法中,价值函数通常定义为整个开发集上的预测精度。然而,这限制了对有益于或有害于其自身类的训练实例的区分能力。直观上,有害于自身类的实例可能为噪声或误标,应获得比有益实例更低的估值。本工作中,我们提出 CS-Shapley,一种带有新价值函数的 Shapley 值,可区分训练实例的类内与类外贡献。我们的理论分析表明,所提价值函数(本质上)是满足分类中数据估值两项可取性质的唯一函数。此外,我们在两个基准评估任务(数据移除与噪声标签检测)和四个分类器上的实验证明了 CS-Shapley 优于现有方法。最后,我们评估了从一个分类器估计的数据值向其他分类器的“可迁移性”,结果表明基于 Shapley 的数据估值可跨不同模型应用迁移。
引用
@article{arxiv.2211.06800,
title = {CS-Shapley: Class-wise Shapley Values for Data Valuation in Classification},
author = {Stephanie Schoch and Haifeng Xu and Yangfeng Ji},
journal= {arXiv preprint arXiv:2211.06800},
year = {2022}
}
备注
Accepted to NeurIPS 2022