基于模型的高维自适应投影聚类
机器学习
2019-02-25 v1 机器学习
摘要
混合模型是处理具有非独立同分布结构的异质数据的标准方法。然而,当维度相对于样本量较大,且潜在组间均值和协方差/图模型之一或两者可能不同时,混合模型面临统计与计算困难,现有方法实际无法超越左右。我们提出一种称为基于模型的自适应投影聚类(MCAP)的方法。我们不在原始空间估计混合模型,而是使用线性投影获得的低维表示。投影维度本身起重要作用,并主导关于相关信号恢复的某种偏差-方差权衡。MCAP以数据自适应方式利用分配风险的代理自动设定投影维度。将全协方差公式与自适应投影结合,可在极高维问题中检测均值与协方差信号。我们展示了在或更高的实际数据中可靠检测出协方差信号的例子,以及最高达的模拟。在一些例子中,即使均值信号完全去除、仅留高维空间中的差异协方差结构作为唯一信号,MCAP仍表现良好。在多个情形下,MCAP表现与一系列现有方法(包括近期提出的惩罚方法)相当或更好;且性能随维度增加保持广泛稳定。MCAP可‘开箱即用’,在标准桌面计算资源上足以对大问题交互式快速运行。
引用
@article{arxiv.1902.08472,
title = {Model-based clustering in very high dimensions via adaptive projections},
author = {Bernd Taschler and Frank Dondelinger and Sach Mukherjee},
journal= {arXiv preprint arXiv:1902.08472},
year = {2019}
}
备注
25 pages, 15 figures