多类文本分类中合成过采样方法的比较
计算与语言
2020-08-12 v1 机器学习
摘要
作者针对多类主题分类问题比较了过采样方法。SMOTE 算法是最流行的过采样方法之一的基础。它包含选取两个少数类样本并基于它们生成一个新样本。在本文中,作者以某一文本分类任务为例,将基本 SMOTE 方法及其两种改进(Borderline SMOTE 和 ADASYN)与随机过采样技术进行了比较。文中讨论了 k 近邻算法、支持向量机算法以及三类神经网络(前馈网络、长短期记忆(LSTM)和双向 LSTM)。作者将这些机器学习算法与不同的文本表示相结合,并比较了合成过采样方法。在大多数情况下,使用过采样技术可显著提升分类质量。作者得出结论:对于该任务,KNN 和 SVM 算法的分类质量比神经网络更易受类不平衡影响。
引用
@article{arxiv.2008.04636,
title = {A Comparison of Synthetic Oversampling Methods for Multi-class Text Classification},
author = {Anna Glazkova},
journal= {arXiv preprint arXiv:2008.04636},
year = {2020}
}
备注
12 pages, 5 figures