中文

用于 k-近邻分类中数据约简的多标签原型生成

机器学习 2025-03-24 v2

摘要

原型生成(PG)方法通常被认为可在处理大规模语料时提升 kk-近邻(kkNN)分类器的效率。此类方法旨在生成语料的约简版本,且与初始集合相比不降低分类性能。尽管其在多类场景中已有大量应用,但极少有工作提出面向多标签空间的 PG 方法。对此,本文提出了四种多类 PG 策略向多标签情形的新颖适配。这些提案通过三种多标签 kkNN 基分类器、涵盖不同领域与语料规模的 12 个语料库以及数据中人为诱导的不同噪声场景进行了评估。所得结果表明,所提适配能够——在效率与分类性能两方面——显著改进文献中唯一的参考多标签 PG 工作以及未应用任何 PG 方法的情况,并且在噪声场景中呈现出统计上更优的鲁棒性。此外,这些新颖 PG 策略可通过其配置根据目标场景优先效率或效能准则,从而覆盖了其他工作此前未填补的解空间中的广泛区域。

关键词

引用

@article{arxiv.2207.10947,
  title  = {Multilabel Prototype Generation for Data Reduction in k-Nearest Neighbour classification},
  author = {Jose J. Valero-Mas and Antonio Javier Gallego and Pablo Alonso-Jiménez and Xavier Serra},
  journal= {arXiv preprint arXiv:2207.10947},
  year   = {2025}
}