数据降维提升机器学习算法效率
计算机视觉与模式识别
2022-11-18 v1 人工智能
机器学习
摘要
数据降维(DDR)旨在将数据从高维映射到低维,多种 DDR 技术被用于图像降维,如随机投影、主成分分析(PCA)、方差法、LSA-Transform、组合与直接法以及新随机法。自编码器(AE)用于学习端到端映射。本文中,我们证明预处理不仅加速算法,还提升监督与无监督学习中的准确率。在 DDR 预处理中,首先基于 PCA 的 DDR 用于监督学习,随后我们探索基于 AE 的 DDR 用于无监督学习。在基于 PCA 的 DDR 中,我们首先比较应用 PCA 前后监督学习算法的准确率与时间。类似地,在基于 AE 的 DDR 中,我们比较 AE 表示学习前后无监督学习算法的准确率与时间。用于分类的监督学习算法包括支持向量机(SVM)、基于 GINI 指数的决策树、基于熵的决策树与随机梯度下降分类器(SGDC),无监督学习算法包括 K-means 聚类。我们使用两个数据集 MNIST 与 FashionMNIST。实验表明,在监督与无监督学习中,预处理后准确率大幅提升且时间显著减少。
引用
@article{arxiv.2211.09392,
title = {Data Dimension Reduction makes ML Algorithms efficient},
author = {Wisal Khan and Muhammad Turab and Waqas Ahmad and Syed Hasnat Ahmad and Kelash Kumar and Bin Luo},
journal= {arXiv preprint arXiv:2211.09392},
year = {2022}
}
备注
Our paper is accepted at International Conference On Emerging Technologies In Electronics, Computing And Communication (ICETECC) 2022