中文

VLUE:越南语自然语言理解的新基准与多任务知识迁移学习

计算与语言 2024-03-26 v1

摘要

各种语言的自然语言理解(NLU)基准的成功,例如英语的GLUE、中文的CLUE、韩语的KLUE和印尼语的IndoNLU,促进了新NLU模型在广泛任务上的评估。为了建立越南语NLU的标准化基准集,我们引入了第一个越南语语言理解评估(VLUE)基准。VLUE基准包含五个数据集,涵盖不同的NLU任务,包括文本分类、跨度提取和自然语言理解。为了提供越南语NLU当前状态的深入概述,我们随后在我们提出的VLUE基准上评估了七个最先进的预训练模型,包括多语言和越南语单语模型。此外,我们提出了CafeBERT,一种新的最先进的预训练模型,在VLUE基准的所有任务上均取得了优异的结果。我们的模型结合了多语言预训练模型的熟练度和越南语语言知识。CafeBERT基于XLM-RoBERTa模型开发,并利用大量越南语文本数据进行额外的预训练步骤,以增强其对越南语的适应性。出于未来研究的目的,CafeBERT已公开发布供研究使用。

关键词

引用

@article{arxiv.2403.15882,
  title  = {VLUE: A New Benchmark and Multi-task Knowledge Transfer Learning for Vietnamese Natural Language Understanding},
  author = {Phong Nguyen-Thuan Do and Son Quoc Tran and Phu Gia Hoang and Kiet Van Nguyen and Ngan Luu-Thuy Nguyen},
  journal= {arXiv preprint arXiv:2403.15882},
  year   = {2024}
}

备注

Accepted at NAACL 2024 (Findings)