中文

用于无监督学习的逐步回归

机器学习 2017-06-13 v1 机器学习

摘要

我考虑了快速逐步线性回归算法 \cite{efroymson1960multiple} 的无监督扩展。这些扩展允许人们在给定的一组联合分布变量中,高效地识别具有高度代表性的特征变量子集。这进而允许通过移除冗余特征来对大型数据集进行高效的降维。这里的快速搜索是通过避免在试探性拟合中重复计算来实现的,使得对一组特征变量的完整代表性重要性排序可以在 O(n2m)O(n^2 m) 时间内完成,其中 nn 是变量数,mm 是可用数据样本数。这种运行时复杂度与执行单次回归所需的复杂度相同,且比朴素实现快 O(n2)O(n^2)。我提供了适用于高效的前向、后向以及前向-后向无监督特征选择的伪代码。为了说明该算法的应用,我将其应用于在给定金融市场指数中识别代表性股票的问题——这一挑战与交易所交易基金(ETFs)的设计相关。我还描述了这些算法中数值误差随迭代步骤的增长情况,并最终证明且合理解释了在弱相关特征集情况下,前向和后向算法返回完全相反特征排序的观察结果。

关键词

引用

@article{arxiv.1706.03265,
  title  = {Stepwise regression for unsupervised learning},
  author = {Jonathan Landy},
  journal= {arXiv preprint arXiv:1706.03265},
  year   = {2017}
}

备注

9 pages, 2 figures