基于 Shapley 值与互信息的数据估值:改进 K 近邻算法的关键
机器学习
2025-07-11 v4 信息论
math.IT
摘要
K 近邻(KNN)算法广泛用于分类和回归;然而,它存在一些局限性,包括对所有样本的同等对待。我们提出了信息修正 K 近邻(IM-KNN),这是一种利用互信息()和 Shapley 值为邻居分配加权值的新方法,从而弥合了以相同值和权重对待所有样本的差距。平均而言,在 12 个基准数据集上,IM-KNN 将传统 KNN 的准确率、精确率和召回率分别提高了 16.80%、17.08% 和 16.98%。在四个大规模数据集上的实验进一步突显了 IM-KNN 对噪声、不平衡数据和偏态分布的鲁棒性。
引用
@article{arxiv.2312.01991,
title = {Shapley-Based Data Valuation with Mutual Information: A Key to Modified K-Nearest Neighbors},
author = {Mohammad Ali Vahedifar and Azim Akhtarshenas and Mohammad Mohammadi Rafatpanah and Maryam Sabbaghian},
journal= {arXiv preprint arXiv:2312.01991},
year = {2025}
}
备注
This paper has been accepted for publication in the IEEE Machine Learning and Signal Processing conference (MLSP 2025)