具批次水平丰度依赖缺失数据机制的不完整数据的混合效应模型
应用统计
2016-01-26 v1
摘要
在基于质谱的定量蛋白质组学研究中,新兴的 iTRAQ 技术已被广泛采用用于高通量蛋白质分析,因为它允许在一次多重实验中同时测量多个样本,从而大大提高蛋白质定量的通量。然而,由于 MS 仪器的动态特性,不同 iTRAQ 多重实验间技术变异通常较大。这导致 iTRAQ 数据中存在强烈的批次效应。此外,iTRAQ 数据常包含显著的批次水平不可忽略缺失。具体而言,给定蛋白质/肽段的丰度度量常在同一批次的所有样本中整体缺失,且缺失概率取决于组合的批次水平丰度。我们将这种独特的缺失数据机制称为批次水平丰度依赖缺失机制(BADMM)。我们引入一种新方法 mixEMM,用于分析具有批次效应和批次水平不可忽略缺失的 iTRAQ 数据。mixEMM 方法采用线性混合效应模型,并在似然函数中显式建模批次效应和 BADMM。通过模拟研究,我们表明与利用相对丰度并在完全随机缺失假设下忽略缺失批次的现有方法相比,mixEMM 方法实现了更准确的参数估计和推断。我们将该方法应用于一项乳腺癌研究的 iTRAQ 蛋白质组学数据,并识别了不同乳腺癌亚型间差异表达的磷酸肽。该方法可应用于具有簇水平不可忽略缺失数据机制的一般聚类数据。
引用
@article{arxiv.1601.06236,
title = {A Mixed-effects Model for Incomplete Data With Batch-Level Abundance-Dependent Missing-Data Mechanism},
author = {Lin S. Chen and Jiebiao Wang and Xianlong Wang and Pei Wang},
journal= {arXiv preprint arXiv:1601.06236},
year = {2016}
}
备注
23 pages, 3 figures