中文

SMTCE:面向越南语社交媒体文本分类的评测基准与BERTology模型

计算与语言 2022-09-22 v1

摘要

文本分类是典型的自然语言处理或计算语言学任务,具有多种有趣应用。随着社交媒体平台用户数量的增加,数据加速推动了关于社交媒体文本分类(SMTC)或在这些宝贵资源上的社交媒体文本挖掘的新兴研究。与英语相比,越南语作为一种低资源语言,仍未得到充分关注与深入利用。受GLUE成功的启发,我们引入了社交媒体文本分类评测(SMTCE)基准,作为跨越多种SMTC任务的数据集与模型的集合。基于所提出的基准,我们实现并分析了多种多语言BERT基模型(mBERT、XLM-R和DistilmBERT)与单语BERT基模型(PhoBERT、viBERT、vELECTRA和viBERT4news)在SMTCE基准任务中的有效性。单语模型优于多语言模型,并在所有文本分类任务上取得最先进(SOTA)结果。它为基准上多语言与单语BERT基模型提供了客观评估,将有益于未来关于越南语BERTology的研究。

关键词

引用

@article{arxiv.2209.10482,
  title  = {SMTCE: A Social Media Text Classification Evaluation Benchmark and BERTology Models for Vietnamese},
  author = {Luan Thanh Nguyen and Kiet Van Nguyen and Ngan Luu-Thuy Nguyen},
  journal= {arXiv preprint arXiv:2209.10482},
  year   = {2022}
}

备注

Accepted at The 36th annual Meeting of Pacific Asia Conference on Language, Information and Computation (PACLIC 36)