基于截断正态无限因子模型的缺失数据插值及其在代谢组学数据中的应用
统计方法学
2025-08-22 v2
摘要
代谢组学是研究生物样本中小分子的学科。代谢组学数据通常是高维的,包含高度相关的变量和频繁的缺失值。由于获取或处理错误导致的随机缺失(MAR)以及由于值低于检测阈值而导致的非随机缺失(MNAR)都很常见。因此,插值是下游分析的关键组成部分。现有的插值方法通常假设一种数据缺失机制,或对插值结果超出数据物理约束的值。提出一种新的截断正态无限因子分析(TGIFA)模型,用于在代谢组学数据中进行统计原则且符合物理约束的插值。通过采用截断正态假设,TGIFA 尊重数据物理约束,同时利用无限潜在因子框架在无需预先指定潜在因子数量的情况下捕获高维依赖关系。我们的贝叶斯推断方法使我们能够对插值后数据的值以及缺失数据机制进行不确定性量化。一个计算高效的交换算法使我们能够通过马尔可夫链蒙特卡罗实现可扩展的后验推断。我们通过全面的模拟研究验证了 TGIFA,并在一个说服性的尿液代谢组学数据集中展示了其实用性,该模型产生有用的插值结果,并伴随不确定性量化。TGIFA 的开源 R 代码已公开,地址为 https://github.com/kfinucane/TGIFA。
引用
@article{arxiv.2410.10633,
title = {Missing data imputation using a truncated Gaussian infinite factor model with application to metabolomics data},
author = {Kate Finucane and Lorraine Brennan and Roberta De Vito and Massimiliano Russo and Isobel Claire Gormley},
journal= {arXiv preprint arXiv:2410.10633},
year = {2025}
}