用于 k-近邻分类中数据约简的多标签原型生成
机器学习
2025-03-24 v2
摘要
原型生成(PG)方法通常被认为可在处理大规模语料时提升 -近邻(NN)分类器的效率。此类方法旨在生成语料的约简版本,且与初始集合相比不降低分类性能。尽管其在多类场景中已有大量应用,但极少有工作提出面向多标签空间的 PG 方法。对此,本文提出了四种多类 PG 策略向多标签情形的新颖适配。这些提案通过三种多标签 NN 基分类器、涵盖不同领域与语料规模的 12 个语料库以及数据中人为诱导的不同噪声场景进行了评估。所得结果表明,所提适配能够——在效率与分类性能两方面——显著改进文献中唯一的参考多标签 PG 工作以及未应用任何 PG 方法的情况,并且在噪声场景中呈现出统计上更优的鲁棒性。此外,这些新颖 PG 策略可通过其配置根据目标场景优先效率或效能准则,从而覆盖了其他工作此前未填补的解空间中的广泛区域。
引用
@article{arxiv.2207.10947,
title = {Multilabel Prototype Generation for Data Reduction in k-Nearest Neighbour classification},
author = {Jose J. Valero-Mas and Antonio Javier Gallego and Pablo Alonso-Jiménez and Xavier Serra},
journal= {arXiv preprint arXiv:2207.10947},
year = {2025}
}