教程:聚类分析、潜类别分析与多元混合模型样本量、效应量与统计功效的先验估计
统计方法学
2023-09-06 v1 机器学习
其他定量生物学
摘要
在着手收集数据之前,研究者通常计算应进行多少个体观测。这对于开展具有充足统计功效的研究至关重要,且常是研究预注册与基金申请的基石。对于传统统计检验,通常会确定一个可接受的统计功效水平,(猜)估计效应量,再利用这两个值计算所需样本量。然而,对于识别子群的分析,统计功效更难确定。一旦样本量达到充足阈值,效应量主要由测得特征的数量与潜在的子群分离度决定。因此,统计功效的先验计算 notoriously 复杂。本教程提供一条确定子群识别分析样本量与效应量的路线图。首先,我介绍一种流程,使研究者能形式化其在所选领域中关于效应量的预期,并借此计算所需最少测得变量数。接着,概述如何在子群分析中确立最小样本量。最后,我通过模拟为最流行的子群分析提供参照表:k-means、Ward 凝聚层次聚类、c-means 模糊聚类、潜类别分析、潜剖面分析与高斯混合建模。该表显示了为达到可接受统计功效所需的每预期子群最少观测数(样本量)与特征数(测得变量),可直接用于研究设计。
引用
@article{arxiv.2309.00866,
title = {Tutorial: a priori estimation of sample size, effect size, and statistical power for cluster analysis, latent class analysis, and multivariate mixture models},
author = {Edwin S Dalmaijer},
journal= {arXiv preprint arXiv:2309.00866},
year = {2023}
}
备注
Code and data: https://github.com/esdalmaijer/cluster_power_tutorial