中文

从通用语言模型到下游任务:改进基于 RoBERTa 的越南语仇恨语音检测

计算与语言 2021-02-25 v1 机器学习

摘要

自然语言处理是人工智能中一个快速增长的领域。自 2017 年 Google 引入 Transformer 以来,大量语言模型如 BERT、GPT 和 ELMo 受此架构启发而产生。这些模型在海量数据集上训练,并在自然语言理解上取得了 SOTA 结果。然而,在小得多的数据集上对预训练语言模型进行微调以用于下游任务,需要精心设计的流程来缓解数据集的问题,如训练数据缺乏和类别不平衡。在本文中,我们提出一个流程,将通用 RoBERTa 语言模型适配于一个特定的文本分类任务:越南语仇恨语音检测。我们首先通过在掩码语言模型任务上重新训练模型,在我们的数据集上调整 PhoBERT;然后,我们利用其编码器进行文本分类。为了在保留预训练权重的同时学习新的特征表示,我们进一步采用不同的训练技术:层冻结、分块学习率和标签平滑。我们的实验证明,我们提出的流程显著提升了性能,在越南语仇恨语音检测竞赛上以 0.7221 的 F1 分数取得了新的 SOTA。

关键词

引用

@article{arxiv.2102.12162,
  title  = {From Universal Language Model to Downstream Task: Improving RoBERTa-Based Vietnamese Hate Speech Detection},
  author = {Quang Huu Pham and Viet Anh Nguyen and Linh Bao Doan and Ngoc N. Tran and Ta Minh Thanh},
  journal= {arXiv preprint arXiv:2102.12162},
  year   = {2021}
}

备注

Published in 2020 12th International Conference on Knowledge and Systems Engineering (KSE)