中文

概率分类器上的 Shapley 值

机器学习 2023-06-13 v1 数据库

摘要

由于数据的经济价值,数据估值已成为数据科学中日益重要的学科。在机器学习(ML)背景下,数据估值方法旨在公平地度量每个数据点对 ML 模型效用的贡献。一种流行的方法是 Shapley 值,它有助于识别对 ML 模型有益或有害的数据点。然而,传统的基于 Shapley 的数据估值方法可能无法有效区分概率分类器的有益和有害训练数据点。在本文中,我们提出概率 Shapley(P-Shapley)值,通过构造一个利用概率分类器预测类别概率而非传统 Shapley 值中二值化预测结果的概率式效用函数。我们还提供了若干用于置信度校准的激活函数,以有效量化每个数据点对概率分类器的边际贡献。在四个真实世界数据集上的大量实验证明了我们提出的 P-Shapley 值在评估数据对构建高可用且可信 ML模型的重要性方面的有效性。

关键词

引用

@article{arxiv.2306.07171,
  title  = {Shapley Value on Probabilistic Classifiers},
  author = {Xiang Li and Haocheng Xia and Jinfei Liu},
  journal= {arXiv preprint arXiv:2306.07171},
  year   = {2023}
}