中文

能否以少胜多?探索有毒评论分类中的数据增强

计算与语言 2020-07-03 v1 人工智能 信息检索 机器学习

摘要

本文探讨了机器学习中最大的局限之一:数据稀缺。具体而言,我们探索能否利用数据增强技术与机器学习算法的组合,从小型数据集构建高准确率分类器。在本文中,我们尝试了简易数据增强(EDA)与回译,以及三种流行学习算法:逻辑回归、支持向量机(SVM)和双向长短期记忆网络(Bi-LSTM)。为实验,我们使用了 Wikipedia 有毒评论数据集,以便在探索数据增强益处的同时,开发用于检测并分类评论中有毒言论的模型,从而助力打击网络霸凌与在线骚扰。最终,我们发现数据增强技术可显著提振分类器性能,是应对 NLP 问题中数据匮乏的优异策略。

关键词

引用

@article{arxiv.2007.00875,
  title  = {Can We Achieve More with Less? Exploring Data Augmentation for Toxic Comment Classification},
  author = {Chetanya Rastogi and Nikka Mofid and Fang-I Hsiao},
  journal= {arXiv preprint arXiv:2007.00875},
  year   = {2020}
}

备注

11 pages, 15 figures