中文

多类文本分类中合成过采样方法的比较

计算与语言 2020-08-12 v1 机器学习

摘要

作者针对多类主题分类问题比较了过采样方法。SMOTE 算法是最流行的过采样方法之一的基础。它包含选取两个少数类样本并基于它们生成一个新样本。在本文中,作者以某一文本分类任务为例,将基本 SMOTE 方法及其两种改进(Borderline SMOTE 和 ADASYN)与随机过采样技术进行了比较。文中讨论了 k 近邻算法、支持向量机算法以及三类神经网络(前馈网络、长短期记忆(LSTM)和双向 LSTM)。作者将这些机器学习算法与不同的文本表示相结合,并比较了合成过采样方法。在大多数情况下,使用过采样技术可显著提升分类质量。作者得出结论:对于该任务,KNN 和 SVM 算法的分类质量比神经网络更易受类不平衡影响。

关键词

引用

@article{arxiv.2008.04636,
  title  = {A Comparison of Synthetic Oversampling Methods for Multi-class Text Classification},
  author = {Anna Glazkova},
  journal= {arXiv preprint arXiv:2008.04636},
  year   = {2020}
}

备注

12 pages, 5 figures