基于闵可夫斯基加权 k-均值的簇自适应特征提取及其理论基础
机器学习
2026-05-22 v2
摘要
闵可夫斯基加权 k-均值(mwk-means)算法通过引入特征权重和闵可夫斯基距离扩展了经典的 k-均值。我们首先证明,mwk-means 目标函数可表示为簇内离散度的幂均值聚合,阶数由闵可夫斯基指数 决定。该表示揭示了 如何控制特征的选择性使用与均匀使用之间的转换。利用这一表示,我们推导了目标函数的界并刻画了特征权重的结构,表明它们仅依赖于相对离散度并与离散度比率遵循幂律关系。这导出了对高离散度特征抑制的明确保证,并建立了算法的收敛性。基于这些理论结果,我们提出了簇自适应特征提取(CAFE),一种利用 mwk-means 特征权重在无监督特征提取前对数据进行重缩放的方法。我们证明这种重缩放逆转了簇内离散度的排序,抑制了噪声特征并放大了信息特征。在受控簇内噪声条件下进行的众多实验表明,CAFE 一致地提升了传统特征提取方法的结果。
引用
@article{arxiv.2603.25958,
title = {Cluster-Adaptive Feature Extraction and its Theoretical Foundation with Minkowski Weighted k-Means},
author = {Renato Cordeiro de Amorim and Vladimir Makarenkov},
journal= {arXiv preprint arXiv:2603.25958},
year = {2026}
}