人类代谢组学数据统计分析方法定量比较
定量方法
2018-02-21 v2 应用统计
摘要
背景。新兴技术现已允许对越来越多生物样本中多达数千种小分子代谢物 (代谢组学) 进行基于质谱的分析。虽然这为揭示人类疾病发病机制提供了巨大希望, 但针对日益复杂、高维的人类代谢组学数据与包括疾病结局在内的临床表型之间关系的统计分析, 尚未建立标准方法。为确定代谢组学分析的最优统计方法, 我们试图在一系列代谢组学数据集类型中正式比较传统统计方法与较新的统计学习方法。结果。在源自大规模人群队列的模拟和实验代谢组学数据中, 我们观察到随着研究对象数量的增加, 由于代谢物间存在显著相关性, 单变量方法与多变量方法相比导致更高的错误发现率。在检测代谢物数量增加的场景中, 如非靶向与靶向代谢组学测量的应用, 多变量方法在一系列统计操作特性上表现尤为优越。在包含数千种代谢物测量的非靶向代谢组学数据集中, 稀疏多变量模型表现出更高的选择性和更低的虚假关系可能性。结论。当代谢物数量接近或超过研究对象数量时 (这在相对较小规模队列的非靶向代谢组学分析中很常见), 稀疏多变量模型展现出最稳健的统计功效和更一致的结果。这些发现对人类疾病代谢组学研究的分析具有重要意义。
引用
@article{arxiv.1710.03443,
title = {Quantitative Comparison of Statistical Methods for Analyzing Human Metabolomics Data},
author = {Brian L. Claggett and Joseph Antonelli and Mir Henglin and Jeramie D. Watrous and Kim A. Lehmann and Gabriel Musso and Andrew Correia and Sivani Jonnalagadda and Olga V. Demler and Ramachandran S. Vasan and Martin G. Larson and Mohit Jain and Susan Cheng},
journal= {arXiv preprint arXiv:1710.03443},
year = {2018}
}