基于零膨胀泊松模型与共识聚合的鲁棒贝叶斯张量分解
机器学习
2023-08-17 v1 机器学习
代数几何
基因组学
应用统计
摘要
张量分解(TF)是高效表示和分析多维数据的有力工具。然而,基于极大似然估计的经典 TF 方法在应用于零膨胀计数数据(如单细胞 RNA 测序(scRNA-seq)数据)时表现不佳。此外,TF 固有的随机性导致重复运行得到的因子各不相同,使结果的解释和复现具有挑战性。本文提出零膨胀泊松张量分解(ZIPTF),一种用于分解含过多零值的高维计数数据的新方法。为应对随机性挑战,我们引入共识零膨胀泊松张量分解(C-ZIPTF),将 ZIPTF 与基于共识的荟萃分析相结合。我们在合成的零膨胀计数数据以及合成和真实的 scRNA-seq 数据上评估所提出的 ZIPTF 和 C-ZIPTF。在零膨胀数据的重建精度上,ZIPTF 始终优于基线的矩阵与张量分解方法。当过多零值的概率较高时,ZIPTF 实现了高达 的精度提升。此外,C-ZIPTF 显著提升了分解的一致性与准确性。在合成和真实 scRNA-seq 数据上的测试中,ZIPTF 和 C-ZIPTF 均能稳定恢复已知且具有生物学意义的基因表达程序。
引用
@article{arxiv.2308.08060,
title = {Robust Bayesian Tensor Factorization with Zero-Inflated Poisson Model and Consensus Aggregation},
author = {Daniel Chafamo and Vignesh Shanmugam and Neriman Tokcan},
journal= {arXiv preprint arXiv:2308.08060},
year = {2023}
}