面向混杂偏倚的净化聚类方法
机器学习
2023-11-03 v1
摘要
现实世界的数据集不可避免地包含数据收集过程中由不同来源或条件产生的偏倚。因此,这种不一致性本身充当了干扰聚类分析的混杂因素。现有方法通过在聚类前将数据投影到由混杂因素张成子空间的正交补上来消除偏倚。其中,感兴趣的聚类因素与混杂因素在原始特征空间中被粗略考虑,且数据与该混杂因素之间的相关性为方便求解被理想化地假设为线性。这些方法因而适用范围有限,因为实际应用中的数据通常与混杂因素呈复杂且非线性相关。本文提出一种新的聚类框架,称为面向混杂偏倚的净化聚类(SCAB),其通过非线性依赖度量在复杂数据的语义潜空间中去除混杂因素。具体而言,我们通过最小化混杂因素与变分自编码器(VAE)给出的潜表示之间的互信息,来消除潜空间中的偏倚信息。同时,引入一个聚类模块在净化后的潜表示上进行聚类。在复杂数据集上的大量实验表明,我们的 SCAB 通过去除混杂偏倚在聚类性能上取得了显著提升。代码见 \url{https://github.com/EvaFlower/SCAB}。
引用
@article{arxiv.2311.01252,
title = {Sanitized Clustering against Confounding Bias},
author = {Yinghua Yao and Yuangang Pan and Jing Li and Ivor W. Tsang and Xin Yao},
journal= {arXiv preprint arXiv:2311.01252},
year = {2023}
}
备注
Machine Learning, in press