中文

通过全局增强方法改进短文本分类

计算与语言 2020-12-11 v2 信息检索 机器学习

摘要

我们研究不同文本增强方法的效果。为此,我们使用 3 个数据集,包含社交媒体文本以及新闻文章形式的正式文本。我们的目标是为从业者和研究者在分类用例的增强选择上提供见解。我们观察到,当无法获得正式同义词模型(如基于 WordNet 的增强)时,基于 Word2vec 的增强是一种可行选择。使用 \emph{mixup} 进一步提升了所有基于文本的增强的性能,并降低了所测试深度学习模型上的过拟合效应。借助翻译服务的回译因成本较高而更难使用,因而对常规和低资源用例均较不易获取。

关键词

引用

@article{arxiv.1907.03752,
  title  = {Improving short text classification through global augmentation methods},
  author = {Vukosi Marivate and Tshephisho Sefara},
  journal= {arXiv preprint arXiv:1907.03752},
  year   = {2020}
}

备注

Final version published in CD-MAKE 2020: Machine Learning and Knowledge Extraction pp 385-399