中文

使用基于模型的聚类进行效应融合

统计方法学 2017-03-23 v1

摘要

在社会学和经济学研究中,许多收集到的变量以名义尺度测量,通常具有大量类别。类别的定义通常并非唯一,使用更细或更粗网格的不同分类方案均有可能。当此类变量作为协变量纳入回归模型时,分类方式会产生影响:过细的网格会导致相应效应的估计不精确,而过粗的网格则会遗漏重要效应,导致效应估计有偏及预测性能不佳。为实现具有本质相同效应的水平自动分组,我们采用贝叶斯方法,并将水平效应的先验指定为尖峰正态分量的位置混合。通过在混合权重上设置鼓励空分量的先验,诱导水平效应的融合。在 MCMC 采样过程中对效应进行基于模型的聚类,能够同时检测具有本质相同效应大小的类别,并识别出完全没有效应的变量。通过模拟研究考察了该方法的性质。最后,将该方法应用于分析高维分类预测变量对奥地利收入的影响。

关键词

引用

@article{arxiv.1703.07603,
  title  = {Effect fusion using model-based clustering},
  author = {Gertraud Malsiner-Walli and Daniela Pauger and Helga Wagner},
  journal= {arXiv preprint arXiv:1703.07603},
  year   = {2017}
}