基于加权维度的模式分类
机器学习
2025-10-24 v1
摘要
在处理多维样本及其在各种应用场景中的模式分类时, 常常需要关注其诸多方面。 在这一概念下, 加权维度距离度量方法是模式分析中重要考虑因素, 因其能反映样本间相似度的程度。 虽然以往常以欧几里得距离为中心, 但仍会引发诸多问题。 本文提出 (a) 对距离度量范数与维度权重影响的详尽分析与可视化, (b) 每个维度的新型加权方案, (c) 将该维度加权方案引入K近邻分类器, 以及 (d) 在多种合成数据集和真实数据集上进行模式分类实验。 实验结果表明, 在相同实验设置下, 本方法优于传统K近邻方法。 特别地, 在基因表达数据集上, 所有交叉验证实验中均实现约10%的分类准确率提升。 由于该类数据集样本数有限且维度高, 对最近邻居选择具有重要意义, 而本文提出的加权方案能够通过调节包围k个参考样本区域的形状和大小, 有效满足这一需求。 因此, 本文构成了一个基于加权闵氏距离、运用新型加权方案的K近邻分类器的重要推广。
引用
@article{arxiv.2510.20107,
title = {On pattern classification with weighted dimensions},
author = {Ayatullah Faruk Mollah},
journal= {arXiv preprint arXiv:2510.20107},
year = {2025}
}