面向大数据的有监督降维
机器学习
2021-01-26 v9
摘要
为解决关键生物医学问题,实验者现在常规地每个样本测量数百万或数十亿个特征(维度),希望数据科学技术能够建立准确的数据驱动推断。因为样本量通常比这些数据的维度小几个数量级,有效的推断需要找到保留判别信息(例如,个体是否患有特定疾病)的低维表示。缺乏可扩展到数百万维度且具有强统计理论保证的可解释有监督降维方法。我们引入一种称为XOX的方法,通过将对类条件矩估计合并到低维投影中来扩展主成分分析。最简单的版本,“线性最优低秩”投影(LOL),合并了类条件均值。我们证明并用合成和真实数据基准证实,LOL及其在XOX框架中的推广导致后续分类的改进数据表示,同时保持计算效率和可扩展性。使用包含>1.5亿个特征的多个脑成像数据集,以及几个具有>50万特征的基因组数据集,LOL在准确性方面优于其他可扩展线性降维技术,同时仅需在标准台式计算机上几分钟。
引用
@article{arxiv.1709.01233,
title = {Supervised Dimensionality Reduction for Big Data},
author = {Joshua T. Vogelstein and Eric Bridgeford and Minh Tang and Da Zheng and Christopher Douville and Randal Burns and Mauro Maggioni},
journal= {arXiv preprint arXiv:1709.01233},
year = {2021}
}
备注
6 figures