ViSoBERT:面向越南语社交媒体文本处理的预训练语言模型
计算与语言
2023-10-31 v2
摘要
英语和中文作为资源丰富的语言,基于 transformer 的语言模型在自然语言处理任务上已得到强劲发展。尽管越南约有 1 亿人使用越南语,已有若干预训练模型(如 PhoBERT、ViBERT 和 vELECTRA)在包括词性标注和命名实体识别在内的通用越南语 NLP 任务上表现良好。这些预训练语言模型在越南语社交媒体任务上仍显不足。本文提出首个面向越南语社交媒体文本的单语预训练语言模型 ViSoBERT,其基于 XLM-R 架构,在大规模高质量且多样的越南语社交媒体文本语料上进行预训练。此外,我们在越南语社交媒体文本上的五项重要自然语言下游任务中探索了我们的预训练模型:情绪识别、仇恨言论检测、情感分析、垃圾评论检测以及仇恨言论片段检测。实验表明,ViSoBERT 以远少的参数量在多个越南语社交媒体任务上超越了先前的 SOTA 模型。我们的 ViSoBERT 模型仅用于研究目的。
引用
@article{arxiv.2310.11166,
title = {ViSoBERT: A Pre-Trained Language Model for Vietnamese Social Media Text Processing},
author = {Quoc-Nam Nguyen and Thang Chau Phan and Duc-Vu Nguyen and Kiet Van Nguyen},
journal= {arXiv preprint arXiv:2310.11166},
year = {2023}
}
备注
Accepted at EMNLP'2023 Main Conference