中文

机器学习中数据中心化的特征分析

机器学习 2014-07-11 v1 计算机视觉与模式识别 机器学习 谱理论 统计理论 统计理论

摘要

许多模式识别方法依赖于中心化数据的统计信息,例如主成分分析 (PCA) 中协方差矩阵的特征分析,以及偏最小二乘回归、典型相关分析和 Fisher 判别分析。最近,许多研究者主张使用非中心化数据。例如奇异值分解方法、(核)熵成分分析、信息论学习框架,甚至非负矩阵分解。此外,还可以通过使用二阶非中心矩来考虑非中心化 PCA。本文的主要目的是弥合这两种观点在机器学习方法设计中的差距。为了在核机器的基石上进行研究,我们对中心化和非中心化数据的内积矩阵进行了特征分析。我们推导了连接其特征值和特征向量的若干结果。此外,我们探索了外积矩阵,提供了连接协方差矩阵及其非中心化对应矩阵的最大特征向量的结果。这些结果为超越传统中心化的扩展奠定了基础,包括加权均值漂移、秩一更新和多维缩放。在模拟和真实数据上进行的实验说明了本文的相关性。

关键词

引用

@article{arxiv.1407.2904,
  title  = {An eigenanalysis of data centering in machine learning},
  author = {Paul Honeine},
  journal= {arXiv preprint arXiv:1407.2904},
  year   = {2014}
}

备注

14 pages