参数与非参数方法对高维稀疏矩阵表示的影响
机器学习
2022-02-08 v1
摘要
语义从文本数据中导出,为机器学习算法提供表示。这些表示是高维稀疏矩阵的可解释形式,作为机器学习算法的输入。由于学习方法广义上分为参数与非参数学习方法,本文给出这两类算法对高维稀疏矩阵表示的影响。为从文本数据导出表示,我们采用了文中具合理依据的 TF-IDF 表示。我们分别构建了 50、100、500、1000 和 5000 维的表示,并在其上使用线性判别分析与朴素贝叶斯作为参数学习方法、决策树与支持向量机作为非参数学习方法进行分类。我们随后给出了表示各维度上的度量,并详述了每种算法的效果。
引用
@article{arxiv.2202.02894,
title = {Effects of Parametric and Non-Parametric Methods on High Dimensional Sparse Matrix Representations},
author = {Sayali Tambe and Raunak Joshi and Abhishek Gupta and Nandan Kanvinde and Vidya Chitre},
journal= {arXiv preprint arXiv:2202.02894},
year = {2022}
}
备注
7 pages, 6 tables, 13 equations