理解 Poisson 对数正态模型何时在微生物组计数数据上优于惩罚 Poisson 回归
机器学习
2026-04-07 v1
摘要
多变量计数模型通常因其捕捉潜在依赖的能力而具有合理性,但研究者在简单惩罚边缘 Poisson 回归之上何时能因这种额外结构而获益方面很少得到指导。我们通过统一留出评估框架,利用真实微生物组数据研究这一问题。在计数预测方面,我们在 20 个数据集上比较 PLN 和 GLMNet(Poisson),这些数据集涵盖 32 到 18,270 个样本和 24 到 257 个分类单元,使用留一分类单元预测下的留出 Poisson 偏差,而非合成或样本内准则。在网络推断方面,我们在五个具有实验验证微生物相互作用真实标签的公开数据集上比较 PLNNetwork 和 GLMNet(Poisson) 邻域选择。PLN 在大多数计数预测数据集上优于 GLMNet(Poisson),提升幅度高达 38%。主要预测因素是样本与分类单元之比,平均绝对相关性是最强的次要信号,过度离散是额外预测因素。PLNNetwork 在广泛的无向相互作用基准上表现最佳,而 GLMNet(Poisson) 更适合局部或方向性效应。综合来看,这些结果为在生物计数预测和相互作用恢复中选择潜变量多变量计数模型与惩罚 Poisson 回归提供了指导。
引用
@article{arxiv.2604.03853,
title = {Understanding When Poisson Log-Normal Models Outperform Penalized Poisson Regression for Microbiome Count Data},
author = {Daniel Agyapong and Julien Chiquet and Jane Marks and Toby Dylan Hocking},
journal= {arXiv preprint arXiv:2604.03853},
year = {2026}
}