中文

非参数最近邻随机过程聚类

机器学习 2016-11-18 v1 信息论 机器学习 math.IT

摘要

我们考虑在不知生成模型统计特性及生成模型数量先验知识的情况下,根据非参数生成模型对平稳遍历随机过程的含噪有限长度观测进行聚类的问题。分析了两种算法,二者均使用估计功率谱密度(PSD)之间的 L1 距离作为相异度度量。第一种算法称为最近邻过程聚类(NNPC),据我们所知是新算法,依赖于通过谱聚类对观测的最近邻图进行划分。第二种算法简称为 k-means(KM),由单次 k-means 迭代配合最远点初始化组成,先前文献中已有考虑,尽管使用了不同的相异度度量且仅有渐近性能结果。我们表明,在噪声下,甚至当生成过程 PSD 显著重叠时,只要观测长度足够大,NNPC 和 KM 都以高概率成功。我们的结果量化了生成过程 PSD 重叠、噪声方差与观测长度之间的权衡。最后,我们给出了合成与真实数据的数值性能结果。

关键词

引用

@article{arxiv.1504.05059,
  title  = {Nonparametric Nearest Neighbor Random Process Clustering},
  author = {Michael Tschannen and Helmut Bölcskei},
  journal= {arXiv preprint arXiv:1504.05059},
  year   = {2016}
}

备注

IEEE International Symposium on Information Theory (ISIT), June 2015, to appear