用于文化数据的显著主成分个数的贝叶斯估计
应用统计
2024-09-19 v1
摘要
主成分分析(PCA)常用于分析与聚类分析一起使用的数据,其取决于所用的主成分个数。因此,确定从数据集中提取的显著主成分个数(PCs)非常重要。本文采用经典PCA的变分贝叶斯版本,开发了一种新的方法,用于估计在样本数与特征数相似或更大的情况下的显著PC个数。这消除了人工确定主成分个数的猜测和潜在偏差,并避免了通过过滤噪声来估计方差时的过度估计。这一框架可以应用于不同形状(行数和列数)的数据集,适用于不同类型的数据(二进制、序数、分类、连续),并且适用于带有噪声和缺失数据的数据。因此,它特别适用于编码任意且行列数相似的数据集,如文化、生态、形态和行为数据集。我们在合成数据和经验数据上测试了该方法,发现对于合成数据,它可能低估但不高估主成分个数。每个经验数据集都找到了少数主成分。这些结果表明该方法在生命科学中具有广泛适用性。
引用
@article{arxiv.2409.12129,
title = {Bayesian estimation of the number of significant principal components for cultural data},
author = {Joshua C. Macdonald and Javier Blanco-Portillo and Marcus W. Feldman and Yoav Ram},
journal= {arXiv preprint arXiv:2409.12129},
year = {2024}
}
备注
9 pages, 2 figures