使用基于模型的聚类进行效应融合
统计方法学
2017-03-23 v1
摘要
在社会学和经济学研究中,许多收集到的变量以名义尺度测量,通常具有大量类别。类别的定义通常并非唯一,使用更细或更粗网格的不同分类方案均有可能。当此类变量作为协变量纳入回归模型时,分类方式会产生影响:过细的网格会导致相应效应的估计不精确,而过粗的网格则会遗漏重要效应,导致效应估计有偏及预测性能不佳。为实现具有本质相同效应的水平自动分组,我们采用贝叶斯方法,并将水平效应的先验指定为尖峰正态分量的位置混合。通过在混合权重上设置鼓励空分量的先验,诱导水平效应的融合。在 MCMC 采样过程中对效应进行基于模型的聚类,能够同时检测具有本质相同效应大小的类别,并识别出完全没有效应的变量。通过模拟研究考察了该方法的性质。最后,将该方法应用于分析高维分类预测变量对奥地利收入的影响。
引用
@article{arxiv.1703.07603,
title = {Effect fusion using model-based clustering},
author = {Gertraud Malsiner-Walli and Daniela Pauger and Helga Wagner},
journal= {arXiv preprint arXiv:1703.07603},
year = {2017}
}