多块不完全数据的监督学习
机器学习
2019-01-15 v1 机器学习
应用统计
摘要
在变量多、个体少的高维监督设定中,一个目标是筛选相关变量从而降维。该子空间选择常由监督工具处理。然而,部分数据可能缺失,危及子空间选择的有效性。我们提出一种基于偏最小二乘(PLS)的方法,称为多块数据驱动稀疏 PLS mdd-sPLS,可在通过名为 Koh-Lanta 的新算法对训练与测试缺失数据进行插补的同时,联合进行变量选择与子空间估计。该方法在模拟中对比了均值插补、nipals、softImpute 与 imputeMFA 等已有方法。在高维数据监督分析背景下,所提方法展现出对响应变量的最低预测误差。迄今这是唯一结合数据插补与响应变量预测的方法。监督多块 mdd-sPLS 方法的优势随块内与块间相关性的增强而增大。对来自 rVSV-ZEBOV 埃博拉疫苗试验的真实数据集的应用揭示了有趣且具生物学意义的结果。该方法已实现于 CRAN 上的 R 包与 pypi 上的 Python 包。
引用
@article{arxiv.1901.04380,
title = {Supervised Learning for Multi-Block Incomplete Data},
author = {Hadrien Lorenzo and Jérôme Saracco and Rodolphe Thiébaut},
journal= {arXiv preprint arXiv:1901.04380},
year = {2019}
}
备注
44 pages