中文

具有同步特征自动分组与降维的监督多元学习

机器学习 2022-02-10 v2 机器学习 统计理论 统计方法学 统计理论

摘要

现代高维方法常采用“押注稀疏性”原则,而在监督多元学习中,统计学家可能面临具有大量非零系数的“稠密”问题。本文提出一种新颖的聚类降秩学习(CRL)框架,其施加两种联合矩阵正则化,以在构建预测因子时自动对特征分组。CRL 比低秩建模更具可解释性,并放宽了变量选择中严格的稀疏性假设。本文给出了新的信息论极限,以揭示寻求聚类的固有代价,以及多元学习中维度带来的裨益。此外,开发了一种高效优化算法,其执行子空间学习并聚类且保证收敛。所得不动点估计量虽未必全局最优,但在某些正则条件下享有超出标准似然设定的期望统计精度。此外,提出一种新型信息准则及其无尺度形式,用于聚类和秩的选择,并在不假设无限样本量的情形下具有严格理论支撑。大量模拟与真实数据实验证明了所提方法的统计精度与可解释性。

关键词

引用

@article{arxiv.2112.09746,
  title  = {Supervised Multivariate Learning with Simultaneous Feature Auto-grouping and Dimension Reduction},
  author = {Yiyuan She and Jiahui Shen and Chao Zhang},
  journal= {arXiv preprint arXiv:2112.09746},
  year   = {2022}
}