中文

用于 RNA-seq 计数数据聚类的稀疏负二项混合模型

机器学习 2020-04-28 v2 机器学习

摘要

带变量选择的聚类是现代小 n 大 p 数据的一项具有挑战性却关键的任务。基于稀疏高斯混合模型或稀疏 K-means 的现有方法为连续数据提供了解决方案。随着 RNA-seq 技术的普及以及缺乏用于聚类的计数数据建模,当前的做法是将计数表达数据归一化为连续度量并应用具有高斯假设的现有模型。本文中,我们开发了带有 lasso 或融合 lasso 基因正则化的负二项混合模型,以对具有高维基因特征(大 p)的样本(小 n)进行聚类。EM 算法和贝叶斯信息准则用于推断和确定调优参数。该方法通过大量模拟以及大鼠脑和乳腺癌研究中的两个真实转录组学应用与现有方法进行比较。结果表明,所提出的计数数据模型在聚类准确性、特征选择和通路生物学解释方面具有更优性能。

关键词

引用

@article{arxiv.1912.02399,
  title  = {A sparse negative binomial mixture model for clustering RNA-seq count data},
  author = {Tanbin Rahman and Yujia Li and Tianzhou Ma and Lu Tang and George Tseng},
  journal= {arXiv preprint arXiv:1912.02399},
  year   = {2020}
}