中文

健康与护理研究中 PCA 的优化: 一种可靠的主分量选择方法

统计方法学 2025-04-01 v1

摘要

PCA 在健康与护理研究中广泛用于分析复杂的高维数据集, 如患者健康记录、基因数据和医学影像. 通过降维, PCA 有助于识别关键模式和趋势, 有助于疾病诊断、治疗优化和新生物标志物的发现.然而, 任何降维技术的主要目标都是在保持数据集中关键信息和变异性的同时减少维度.实际中有几种方法可以做到这一点, 如 Kaiser-Guttman 准则、Cattell 残差图检验和百分比累计方差方法.不幸的是, 这些方法的结果截然不同.这意味着使用不恰当的方法来确定在 PCA 中保留的主分量数量可能导致对 PCA 及其相关健康护理研究应用的误解和不准确的结果.在高维场景中(n < p)这种矛盾现象更为突出, 因此更关键的是确定最佳方法.因此, 有必要识别不同技术在健康护理研究中选择 PCA 中保留的主分量数量的缺点. Kaiser-Guttman 准则保留的主分量较少, 导致过度分散;而 Cattell 残差图检验保留的主分量更多, 影响可靠性.百分比累计方差准则提供了更大的稳定性, 始终选择最佳的主分量数量.因此, 显示累计百分比和保留主分量截止点的 Pareto 图提供了最可靠的主分量选择方法, 确保稳定性并提高 PCA 的有效性, 尤其是在健康相关研究中.

关键词

引用

@article{arxiv.2503.24248,
  title  = {Optimizing PCA for Health and Care Research: A Reliable Approach to Component Selection},
  author = {Nuwan Weeraratne and Lyn Hunt and Jason Kurz},
  journal= {arXiv preprint arXiv:2503.24248},
  year   = {2025}
}

备注

Accepted as a poster presentation at NIHR Statistics Group Conference 2025