中文

基于距离的分类器的 PAC-Bayesian 分析:为什么最近邻算法有效!

机器学习 2021-09-29 v1 机器学习

摘要

我们提出了 K-最近邻分类器(K-NN)泛化误差的 PAC-Bayesian 界。这是通过在核带宽趋于零的极限下,将 K-NN 分类器纳入核空间框架来实现的。我们建立了核展开中系数上的先验测度与核空间中权重向量上的诱导测度之间的关系。在系数上定义稀疏先验允许应用 PAC-Bayesian 民间定理,从而得到一个作为冗余训练样本数量函数的泛化界:这些样本是可以被省略而不改变解的样本。所提出的界要求对解的稀疏性量化先验信念,并在学习后已知实际冗余水平时进行评估。即使对于小样本量(m100m \sim 100),当期望稀疏性和实际冗余度都很高时,该界也能给出非平凡的结果。

关键词

引用

@article{arxiv.2109.13889,
  title  = {A PAC-Bayesian Analysis of Distance-Based Classifiers: Why Nearest-Neighbour works!},
  author = {Thore Graepel and Ralf Herbrich},
  journal= {arXiv preprint arXiv:2109.13889},
  year   = {2021}
}

备注

This article was submitted to ICML 2000 and rejected; the references have not been updated since the submission in 2000