中文

单细胞 RNA 测序数据潜变量估计后的推断

统计方法学 2022-10-19 v2 应用统计

摘要

在单细胞 RNA 测序数据分析中,研究者常通过估计潜变量(如细胞类型或伪时间)来刻画细胞间变异,该变量表示单个细胞状态的某些方面。然后他们检验每个基因与所估计潜变量的关联。若这两步使用相同数据,则第二步中计算 p 值与置信区间的标准方法将无法实现诸如第一类错误控制等统计保证。此外,诸如样本分割等可应用于解决其他场景中类似问题的方法在此背景下并不适用。在本文中,我们引入计数分割(count splitting),一种灵活的框架,在泊松假设下,使我们能在该设定中针对几乎任意潜变量估计技术与推断方法进行有效推断。我们在模拟研究中展示了计数分割的第一类错误控制与功效,并将计数分割应用于一组分化为心肌细胞的多能干细胞数据集。

关键词

引用

@article{arxiv.2207.00554,
  title  = {Inference after latent variable estimation for single-cell RNA sequencing data},
  author = {Anna Neufeld and Lucy L. Gao and Joshua Popp and Alexis Battle and Daniela Witten},
  journal= {arXiv preprint arXiv:2207.00554},
  year   = {2022}
}

备注

43 pages, 7 figures