受 Shapley 值启发的 $k$-means 特征加权方法,无需额外超参数
机器学习
2025-08-12 v1
摘要
聚类算法通常假设所有特征对数据结构的贡献相等,这一假设在高维或含噪环境中往往不成立。特征加权方法可以解决此问题,但大多数方法需要额外的参数调优。我们提出 SHARK(Shapley 重加权 -means),一种受合作博弈论中用于量化特征相关性的 Shapley 值启发的特征加权聚类算法,除 -means 本身参数外无需任何额外参数。我们证明 -means 目标函数可分解为每个特征 Shapley 值的总和,为无监督特征相关性提供了公理化基础,并将 Shapley 值计算从指数时间降至多项式时间。SHARK 根据特征 Shapley 贡献的倒数迭代地重新加权特征,强调信息维度并降低无关维度的权重。在合成数据集和真实数据集上的实验表明,SHARK 始终能达到或超越现有方法,展现出卓越的鲁棒性和准确性,尤其在存在噪声的场景中。软件:https://github.com/rickfawley/shark。
引用
@article{arxiv.2508.07952,
title = {Shapley-Inspired Feature Weighting in $k$-means with No Additional Hyperparameters},
author = {Richard J. Fawley and Renato Cordeiro de Amorim},
journal= {arXiv preprint arXiv:2508.07952},
year = {2025}
}