中文

最优扩展邻域规则的 k 近邻集成方法

机器学习 2024-02-19 v2 机器学习

摘要

传统的 k 近邻 (kNN) 方法在球形区域内使用距离公式来确定距测试样本点最近的 k 个训练观测。然而,当测试点位于该区域之外时,此方法可能表现不佳。此外,由于较高的分类误差,聚合多个基 kNN 学习器可能导致较差的集成性能。为解决这些问题,本文提出一种基于最优扩展邻域规则的新集成方法。该规则从距未知观测最近样本点开始,分 k 步确定邻域,并依次选择后续最近数据点,直至达到所需观测数。每个基模型构建于带有随机特征子集的自助样本上,并在构建足够数量模型后依据袋外性能筛选最优模型。所提集成在 17 个基准数据集上采用准确率、Cohen's kappa 和 Brier 分数 (BS) 与最先进方法进行比较。并通过在原始数据中加入人为构造特征来评估所提方法的性能。

关键词

引用

@article{arxiv.2211.11278,
  title  = {Optimal Extended Neighbourhood Rule $k$ Nearest Neighbours Ensemble},
  author = {Amjad Ali and Zardad Khan and Dost Muhammad Khan and Saeed Aldahmani},
  journal= {arXiv preprint arXiv:2211.11278},
  year   = {2024}
}

备注

This manuscript has been submitted for publication in the esteemed journal Pattern Recognition Letters