中文

线性化 GMM 核与归一化随机傅里叶特征

机器学习 2017-02-22 v4 信息检索 机器学习

摘要

“随机傅里叶特征(RFF)”方法已成为近似“径向基函数(RBF)”核的流行工具。RFF 的方差实际上很大。有趣的是,正如我们从理论上证明的,通过简单的归一化步骤可大幅降低方差。我们将改进方案命名为“归一化 RFF (NRFF)”。我们还提出“广义极小极大(GMM)”核作为数据相似性度量。GMM 是正定的,因为存在名为“广义一致加权采样(GCWS)”的关联哈希方法,该方法使此非线性核线性化。我们在 50 多个公开可用数据集上提供了 RBF 核与 GMM 核的广泛实证评估。对于大多数数据集,(免调参的) GMM 核优于最佳调参的 RBF 核。我们进行了大量实验以比较使用 NRFF 线性化的 RBF 核与使用 GCWS 线性化的 GMM 核。我们观察到,为达到可比较的分类精度,GCWS 通常比 NRFF 需要少得多的样本,即使在原始 RBF 核优于原始 GMM 核的数据集上也是如此。GCWS(相比 NRFF)的实证成功也可从理论角度解释。首先,GCWS 的相对方差(由期望平方归一化)比 NRFF 的相对方差小得多,除了非常高相似度区域(此时两种方法的方差都接近于零)。其次,如果我们对数据做模型假设,我们可以解析地证明除非常高相似度区域外,GCWS 在估计同一对象(例如 RBF 核)时表现出比 NRFF 小得多的方差。

关键词

引用

@article{arxiv.1605.05721,
  title  = {Linearized GMM Kernels and Normalized Random Fourier Features},
  author = {Ping Li},
  journal= {arXiv preprint arXiv:1605.05721},
  year   = {2017}
}