中文

基于 Shapley 值与互信息的数据估值:改进 K 近邻算法的关键

机器学习 2025-07-11 v4 信息论 math.IT

摘要

K 近邻(KNN)算法广泛用于分类和回归;然而,它存在一些局限性,包括对所有样本的同等对待。我们提出了信息修正 K 近邻(IM-KNN),这是一种利用互信息(II)和 Shapley 值为邻居分配加权值的新方法,从而弥合了以相同值和权重对待所有样本的差距。平均而言,在 12 个基准数据集上,IM-KNN 将传统 KNN 的准确率、精确率和召回率分别提高了 16.80%、17.08% 和 16.98%。在四个大规模数据集上的实验进一步突显了 IM-KNN 对噪声、不平衡数据和偏态分布的鲁棒性。

关键词

引用

@article{arxiv.2312.01991,
  title  = {Shapley-Based Data Valuation with Mutual Information: A Key to Modified K-Nearest Neighbors},
  author = {Mohammad Ali Vahedifar and Azim Akhtarshenas and Mohammad Mohammadi Rafatpanah and Maryam Sabbaghian},
  journal= {arXiv preprint arXiv:2312.01991},
  year   = {2025}
}

备注

This paper has been accepted for publication in the IEEE Machine Learning and Signal Processing conference (MLSP 2025)