中文

MNAR-$k$-means:一种针对非随机缺失且缺失概率随量级衰减数据的 $k$-means 聚类

机器学习 2026-06-30 v1 机器学习

摘要

经典的 kk-means 聚类基于从所有数据特征计算的距离,不能直接应用于具有缺失值的不完整数据。将 kk-means 扩展到缺失数据的一种自然方式是仅涉及聚类中的观测位置,这相当于用相应的聚类均值插补缺失值。然而,对于非随机缺失(MNAR)数据,由于缺失与数据值相关,这种基于均值插补的方法可能导致估计的聚类中心失真,从而导致较差的聚类结果。由于 MNAR 机制在现实中非常普遍,因此有必要改进基于 kk-means 的聚类方法对此类数据的性能。在本文中,我们关注一种量级衰减的 MNAR 场景,其中数据更可能在绝对值较小的位置缺失,并提出了一种基于插补值大小约束的新型 kk-means 聚类方法,该方法具有良好的数学解释。此外,我们建立了所提方法估计的聚类中心对完全观测数据的真实聚类中心的统计一致性,并通过交替最小化算法解决了所提损失函数的优化问题。模拟实验验证了所提方法在改善聚类结果和减少估计聚类中心偏差方面的效果。对真实缺失数据的应用进一步显示了所提方法的实用性。

关键词

引用

@article{arxiv.2606.31253,
  title  = {MNAR-$k$-means: A $k$-means Clustering for Data Missing Not at Random with Magnitude-Decaying Probability},
  author = {Xin Guan},
  journal= {arXiv preprint arXiv:2606.31253},
  year   = {2026}
}