用于无监督学习的逐步回归
机器学习
2017-06-13 v1 机器学习
摘要
我考虑了快速逐步线性回归算法 \cite{efroymson1960multiple} 的无监督扩展。这些扩展允许人们在给定的一组联合分布变量中,高效地识别具有高度代表性的特征变量子集。这进而允许通过移除冗余特征来对大型数据集进行高效的降维。这里的快速搜索是通过避免在试探性拟合中重复计算来实现的,使得对一组特征变量的完整代表性重要性排序可以在 时间内完成,其中 是变量数, 是可用数据样本数。这种运行时复杂度与执行单次回归所需的复杂度相同,且比朴素实现快 。我提供了适用于高效的前向、后向以及前向-后向无监督特征选择的伪代码。为了说明该算法的应用,我将其应用于在给定金融市场指数中识别代表性股票的问题——这一挑战与交易所交易基金(ETFs)的设计相关。我还描述了这些算法中数值误差随迭代步骤的增长情况,并最终证明且合理解释了在弱相关特征集情况下,前向和后向算法返回完全相反特征排序的观察结果。
引用
@article{arxiv.1706.03265,
title = {Stepwise regression for unsupervised learning},
author = {Jonathan Landy},
journal= {arXiv preprint arXiv:1706.03265},
year = {2017}
}
备注
9 pages, 2 figures