基于混淆的秩相似滤波器用于高维数据上计算高效的机器学习
机器学习
2021-09-29 v1
摘要
我们引入一种新颖的计算高效人工神经网络(ANN)类型,称为秩相似滤波器(RSF)。RSF 可用于变换和分类具有大量数据点及维度的非线性可分数据集。RSF 的权重通过使用数据点中特征的秩顺序设定,或可选地使用特征间“混淆”调整秩(由其数据集中的分布确定)。滤波器的激活强度决定其与数据集中其他点的相似度,该度量与余弦相似度相关。多个 RSF 的激活将样本映射至适于线性分类的新非线性空间(秩相似变换(RST))。我们进一步用此方法创建了非线性秩相似分类器(RSC),一种快速且准确的多类分类器,以及非线性秩相似概率分类器(RSPC),其扩展至多标签情形。我们在多个数据集上评估了这些分类器,RSC 与现有分类器竞争力相当但具有更优的计算效率。RST、RSC 和 RSPC 的开源代码以 Python 编写,使用流行的 scikit-learn 框架以便于获取。在未来扩展中,该算法可应用于适合 ANN 并行化的专用硬件(GPU)及脉冲神经网络(神经形态计算),并获得相应性能提升。这使 RSF 成为高效分析非线性可分数据这一问题的有前景方案。
引用
@article{arxiv.2109.13610,
title = {Confusion-based rank similarity filters for computationally-efficient machine learning on high dimensional data},
author = {Katharine A. Shapcott and Alex D. Bird},
journal= {arXiv preprint arXiv:2109.13610},
year = {2021}
}
备注
19 pages, 4 figures, for code see https://github.com/KatharineShapcott/rank-similarity/