中文

基于 IF-PCA 与若干近期方法的样本聚类

统计方法学 2023-06-09 v1 机器学习 统计理论 应用统计 统计理论

摘要

样本聚类(即利用已测特征将样本如患者或细胞聚为多个组)是一个备受关注的问题。近年来提出了许多方法,其中无监督深度学习 (UDL) 受到了大量关注。两个有趣的问题是 (a) 如何结合 UDL 与其他方法的优势,以及 (b) 这些方法相互之间如何比较。我们将一种流行的 UDL 方法变分自编码器 (VAE) 与近期的有影响特征 PCA (IF-PCA) 思想结合,提出 IF-VAE 作为一种新的样本聚类方法。我们在 10 个基因微阵列数据集和 8 个单细胞 RNA-seq 数据集上研究 IF-VAE 并将其与若干其他方法(包括 IF-PCA、VAE、Seurat 和 SC3)比较。我们发现 IF-VAE 较 VAE 有显著改进,但仍不及 IF-PCA。我们还发现 IF-PCA 颇具竞争力,在 8 个单细胞数据集上略优于 Seurat 和 SC3。IF-PCA 概念简单且允许精细分析。我们证明 IF-PCA 能够在 Rare/Weak 模型中达到相变。相较而言,Seurat 和 SC3 更复杂且在理论上难以分析(出于这些原因,它们的最优性仍不清楚)。

关键词

引用

@article{arxiv.2306.05363,
  title  = {Subject clustering by IF-PCA and several recent methods},
  author = {Dieyi Chen and Jiashun Jin and Zheng Tracy Ke},
  journal= {arXiv preprint arXiv:2306.05363},
  year   = {2023}
}