中文

将分类时间序列聚类为未知数量的簇:一种基于完美模拟的方法

统计方法学 2013-11-12 v1

摘要

Pamminger 和 Fruwirth-Schnatter (2010) 考虑了一种贝叶斯方法,用于在假设固定簇数量的情况下对分类时间序列进行基于模型的聚类。但是,流行的选择簇数量的方法(例如贝叶斯信息准则 BIC)在分类时间序列背景下被证明存在严重问题。在本文中,我们通过采用 Bhattacharya (2008) 引入的贝叶斯半参数混合模型方法,规避了选择簇数量的困难,该方法假设簇数量是一个随机变量,但有上界(可能很大)。我们采用了 Mukhopadhyay 和 Bhattacharya (2012) 的完美模拟方法进行后验模拟,以完全解决底层马尔可夫链蒙特卡洛 (MCMC) 方法的收敛问题。重要的是,在我们的主要完美模拟算法中,出现了必须从具有对数凹全条件密度的一组连续随机变量的联合分布中进行完美模拟的需求。我们提出并开发了一种针对具有对数凹全条件的联合分布的新型高效完美模拟方法。这种完美抽样方法也具有独立意义,因为在非常大且重要的一类贝叶斯应用中,全条件结果是对数凹的。我们将考虑将我们的模型和方法应用于奥地利工资流动性数据(Pamminger 和 Fruwirth-Schnatter (2010) 也曾分析过该数据),并采用 Mukhopadhyay 等人 (2011)、Mukhopadhyay 等人 (2012) 开发的方法,获得聚类的后验众数以及聚类后验分布所需的最高后验分布可信区域。

关键词

引用

@article{arxiv.1311.2422,
  title  = {Clustering Categorical Time Series into Unknown Number of Clusters: A Perfect Simulation based Approach},
  author = {Sabyasachi Mukhopadhyay and Sourabh Bhattacharya},
  journal= {arXiv preprint arXiv:1311.2422},
  year   = {2013}
}

备注

This is not a finished work -- simulations and real data applications are pending. We will provide updates whenever they are available