可转置正则化协方差模型及其在缺失数据插补中的应用
应用统计
2010-11-10 v4 统计方法学
机器学习
摘要
缺失数据估计是处理以矩阵形式排列的高维数据时的一个重要挑战。通常,该数据矩阵是可转置的,意味着行、列或两者均可被视为特征。为了对可转置数据进行建模,我们提出了矩阵正态分布的一种变体——均值受限矩阵正态分布,其中行和列各自拥有独立的均值向量和协方差矩阵。通过对行和列的逆协方差矩阵施加加法惩罚,这些所谓的可转置正则化协方差模型允许对均值和非奇异协方差矩阵进行最大似然估计。利用这些模型,我们在多元和可转置框架下制定了用于缺失数据插补的EM类型算法。我们利用可转置模型的结构给出了理论结果,使得这些模型和插补方法能够应用于高维数据。在微阵列数据和Netflix数据上的模拟和结果表明,这些插补技术通常优于现有方法,并提供了更大的灵活性。
引用
@article{arxiv.0906.3465,
title = {Transposable regularized covariance models with an application to missing data imputation},
author = {Genevera I. Allen and Robert Tibshirani},
journal= {arXiv preprint arXiv:0906.3465},
year = {2010}
}
备注
Published in at http://dx.doi.org/10.1214/09-AOAS314 the Annals of Applied Statistics (http://www.imstat.org/aoas/) by the Institute of Mathematical Statistics (http://www.imstat.org)