中文

最近邻分类中邻域阶数的选择

统计理论 2008-10-30 v1 机器学习 统计理论

摘要

kk阶最近邻规则可以说是最简单且最直观的非参数分类方法。然而,该方法的应用受到对其性质缺乏了解的制约,特别是关于kk值如何影响其性能;同时也缺乏经验选择kk的技术。在本文中,我们详细阐述了kk值如何决定误分类误差。我们考虑了训练样本的两种模型:泊松模型和二项模型。在第一种模型下,数据以泊松流的形式记录,并根据先验概率被“分配”到两个总体之一。特别地,两个训练样本中的总数据量是一个服从泊松分布的随机变量。然而,在二项模型下,训练样本中的总数据量是固定的,尽管每个数据值仍然以随机方式分配。尽管与泊松模型和二项模型相关的风险值和遗憾值不同,但它们在渐近意义下是一阶等价的,并且也与针对二阶导数情形定制的基于核的分类器相关的风险渐近等价。这些性质启发了选择kk值的新方法。

关键词

引用

@article{arxiv.0810.5276,
  title  = {Choice of neighbor order in nearest-neighbor classification},
  author = {Peter Hall and Byeong U. Park and Richard J. Samworth},
  journal= {arXiv preprint arXiv:0810.5276},
  year   = {2008}
}

备注

Published in at http://dx.doi.org/10.1214/07-AOS537 the Annals of Statistics (http://www.imstat.org/aos/) by the Institute of Mathematical Statistics (http://www.imstat.org)