关于共变分布模型的信息论评估
应用统计
2025-03-20 v2 定量方法
摘要
共变分布的统计建模允许生成虚拟人群或在共变数据集中插值缺失的值。共变分布通常具有非高斯边缘分布,并显示非线性相关结构,这些简单的多变量高斯分布无法表示。共变分布建模的显著非高斯框架包括基于共价的模型和基于链式方程多重插值(MICE)的模型。虽然这两种框架已经在生命科学中找到了应用,但对其对理论底层分布的拟合优度进行系统性调查——指示在不同条件下的优势和劣势——仍然缺乏。为弥合这一差距,我们以克隆-戈尔德尔散度(KL-D)为尺度不变的信息论分布良好拟合准则,对共变分布模型进行了彻底的评估。方法论上,我们提出了一种新方法,通过结合基于最近邻的KL-D估计器与基于抽样的不确定性量化来构造KL-D的置信区间。在不同大小和维度的数据集中,包含连续和离散共变的相关数据集中,非高斯模型在KL-D上显著优于简单的高斯或尺度变换近似。KL-D估计也对包括潜在变量和大比例缺失值的情况表现稳健。虽然共价模型在新数据上的泛化行为良好,但MICE呈现出一种倾向于过拟合,其性能始终应该在单独的测试数据上评估。参数共价模型和MICE的尺度比非参数共价模型在数据集维度上表现更好。这一发现证实了非高斯模型在建模真实生命科学共变分布方面的潜力。
引用
@article{arxiv.2406.10611,
title = {Information-theoretic evaluation of covariate distributions models},
author = {Niklas Hartung and Aleksandra Khatova},
journal= {arXiv preprint arXiv:2406.10611},
year = {2025}
}