中文

一种结合多个神经网络模型用于越南语社交媒体数据集的简单高效集成分类器

计算与语言 2020-09-30 v2

摘要

文本分类是自然语言处理的热门课题,当前已吸引全球大量研究投入。社交媒体中数据的显著增长要求研究者高度重视此类数据分析。该领域已有多种语言的大量研究,但越南语方面有限。因此,本研究旨在对来自三个不同越南语基准数据集的社交媒体文本进行分类。本研究使用并优化了先进的深度学习模型,包括CNN、LSTM及其变体。我们还实现了从未应用于这些数据集的BERT。我们的实验为每个特定数据集找到了适合的分类任务模型。为利用单一模型优势,我们提出了一种结合最高性能模型的集成模型。我们的单一模型在各数据集上均取得积极结果。此外,我们的集成模型在所有三个数据集上均取得最佳性能。我们在HSD-VLSP数据集上达到86.96%的F1分数,在UIT-VSMEC数据集上达到65.79%的F1分数,在UIT-VSFC数据集上分别达到情感与主题的92.79%和89.70%。因此,与这些数据集上的先前研究相比,我们的模型取得了更优性能。

关键词

引用

@article{arxiv.2009.13060,
  title  = {A Simple and Efficient Ensemble Classifier Combining Multiple Neural Network Models on Social Media Datasets in Vietnamese},
  author = {Huy Duc Huynh and Hang Thi-Thuy Do and Kiet Van Nguyen and Ngan Luu-Thuy Nguyen},
  journal= {arXiv preprint arXiv:2009.13060},
  year   = {2020}
}

备注

Accepted by The 34th Pacific Asia Conference on Language, Information and Computation (PACLIC2020)