中文

越南语社交媒体文本上文本增强的实证研究

计算与语言 2020-10-12 v2

摘要

在文本分类问题中,数据集中的标签不平衡会影响文本分类模型的性能。实际上,关于社交网站上用户评论的数据并非完整出现——管理员通常只允许正面评论而隐藏负面评论。因此,在收集社交网络上用户评论数据时,数据通常偏向某一标签,导致数据集失衡并削弱模型能力。数据增强技术被用于解决数据集各类别间的不平衡问题,提升预测模型的准确率。本文中,我们在 VLSP2019 越南语社交文本仇恨言论检测与 UIT-VSFC:用于情感分析的越南学生反馈语料上实施了增强技术。增强结果在两个语料上的 F1-macro 分数均提升约 1.5%。

关键词

引用

@article{arxiv.2009.12319,
  title  = {Empirical Study of Text Augmentation on Social Media Text in Vietnamese},
  author = {Son T. Luu and Kiet Van Nguyen and Ngan Luu-Thuy Nguyen},
  journal= {arXiv preprint arXiv:2009.12319},
  year   = {2020}
}

备注

Accepted by The 34th Pacific Asia Conference on Language, Information and Computation