中文

具有缺失机制的 Midpoint 混合模型 (M5):基于似然的质谱蛋白质组学数据量化框架(预印本)

应用统计 2015-07-27 v1

摘要

蛋白质组学数据的统计模型通常将样本 A 和 B 之间的蛋白质倍数变化估计为样本 A 的平均肽段强度除以样本 B 的平均肽段强度。此类平均强度比未能充分利用实验设计优势,该设计通过在相同条件下处理两样本的肽段来消除未观测混杂变量。通常利用估计蛋白质比值为匹配肽段强度的中位数比值来发掘此结构。这一简单方案未能考虑显著的缺失数据偏倚,从而催生了更复杂的平均强度模型。在此,我们开发了首个在利用跨样本肽段水平匹配对的同时考虑不可忽略缺失性的统计模型。我们的模拟分析表明,未能利用肽段水平比值的模型遭受惊人的精度损失,基础 ANOVA 估计的平均 MSE 比中位数比值估计高 371%。进而,中位数比值估计的平均 MSE 比我们的模型估计高 35%。对乳腺癌数据的分析强化了这些关系,并表明我们的模型能够将估计蛋白质的数量增加 22%。

关键词

引用

@article{arxiv.1507.06907,
  title  = {The Midpoint Mixed Model with a Missingness Mechanism (M5): A Likelihood-Based Framework for Quantification of Mass Spectrometry Proteomics Data (Preprint)},
  author = {Jonathon O'Brien and Harsha Gunawardena and Xian Chen and Joseph Ibrahim and Bahjat Qaqish},
  journal= {arXiv preprint arXiv:1507.06907},
  year   = {2015}
}