BAMITA: 张量数组的贝叶斯多重插补
统计方法学
2024-11-01 v1 定量方法
机器学习
摘要
数据在多个生物医学领域越来越多地以多向数组或张量的形式呈现。这类张量通常观测不完整。例如,我们受到纵向微生物组研究的动机,其中多个受试者在多个时间点缺失。关于张量缺失数据插补的文献正在不断增长。然而,现有方法对缺失值仅给出点估计而未捕获不确定性。我们提出了一种在灵活贝叶斯框架下对张量进行多重插补的方法,该方法为缺失条目生成现实的模拟值,并可将不确定性传播到后续分析中。我们的模型对 CANDECOMP/PARAFAC(CP)分解使用高效且广泛适用的共轭先验,并具有可分离的残差协方差结构。该方法在单个条目或整个张量纤维缺失的场景下,在插补准确性和不确定性校准方面均表现良好。对于两个微生物组应用,它被证明能够准确捕获缺失时间点处完整微生物组谱中的不确定性,并用于推断种群的物种多样性趋势。记录我们多重插补方法的 R 代码可在 https://github.com/lockEF/MultiwayImputation 获取。
引用
@article{arxiv.2410.23412,
title = {BAMITA: Bayesian Multiple Imputation for Tensor Arrays},
author = {Ziren Jiang and Gen Li and Eric F. Lock},
journal= {arXiv preprint arXiv:2410.23412},
year = {2024}
}
备注
27 pages, 5 tables, 2 figures