具有同步特征自动分组与降维的监督多元学习
机器学习
2022-02-10 v2 机器学习
统计理论
统计方法学
统计理论
摘要
现代高维方法常采用“押注稀疏性”原则,而在监督多元学习中,统计学家可能面临具有大量非零系数的“稠密”问题。本文提出一种新颖的聚类降秩学习(CRL)框架,其施加两种联合矩阵正则化,以在构建预测因子时自动对特征分组。CRL 比低秩建模更具可解释性,并放宽了变量选择中严格的稀疏性假设。本文给出了新的信息论极限,以揭示寻求聚类的固有代价,以及多元学习中维度带来的裨益。此外,开发了一种高效优化算法,其执行子空间学习并聚类且保证收敛。所得不动点估计量虽未必全局最优,但在某些正则条件下享有超出标准似然设定的期望统计精度。此外,提出一种新型信息准则及其无尺度形式,用于聚类和秩的选择,并在不假设无限样本量的情形下具有严格理论支撑。大量模拟与真实数据实验证明了所提方法的统计精度与可解释性。
引用
@article{arxiv.2112.09746,
title = {Supervised Multivariate Learning with Simultaneous Feature Auto-grouping and Dimension Reduction},
author = {Yiyuan She and Jiahui Shen and Chao Zhang},
journal= {arXiv preprint arXiv:2112.09746},
year = {2022}
}