越南语社交媒体文本上文本增强的实证研究
计算与语言
2020-10-12 v2
摘要
在文本分类问题中,数据集中的标签不平衡会影响文本分类模型的性能。实际上,关于社交网站上用户评论的数据并非完整出现——管理员通常只允许正面评论而隐藏负面评论。因此,在收集社交网络上用户评论数据时,数据通常偏向某一标签,导致数据集失衡并削弱模型能力。数据增强技术被用于解决数据集各类别间的不平衡问题,提升预测模型的准确率。本文中,我们在 VLSP2019 越南语社交文本仇恨言论检测与 UIT-VSFC:用于情感分析的越南学生反馈语料上实施了增强技术。增强结果在两个语料上的 F1-macro 分数均提升约 1.5%。
引用
@article{arxiv.2009.12319,
title = {Empirical Study of Text Augmentation on Social Media Text in Vietnamese},
author = {Son T. Luu and Kiet Van Nguyen and Ngan Luu-Thuy Nguyen},
journal= {arXiv preprint arXiv:2009.12319},
year = {2020}
}
备注
Accepted by The 34th Pacific Asia Conference on Language, Information and Computation