中文

TunBERT:面向突尼斯方言的预训练上下文文本表示

计算与语言 2021-11-29 v1 机器学习

摘要

预训练上下文文本表示模型学习对自然语言的有效表示以使其可被机器理解。在注意力机制取得突破后,随着Transformer的引入,提出了一系列新的预训练模型并取得了良好性能。基于Transformer的双向编码器表示(BERT)已成为语言理解的最先进(state-of-the-art)模型。尽管它们取得了成功,大多数可用模型都是在印欧语系语言上训练的,然而针对代表性不足的语言和方言的类似研究仍然稀少。在本文中,我们研究了为代表性不足的语言训练基于Transformer的单语语言模型的可行性,特别关注突尼斯方言。我们在情感分析任务、方言识别任务和阅读理解问答任务上评估我们的语言模型。我们表明,对于此类非标准化语言,使用噪声网络爬取数据而非结构化数据(维基百科、文章等)更为合适。此外,结果表明相对较小的网络爬取数据集可取得与使用更大数据集相当的性能。最后,我们性能最佳的TunBERT模型在所有三个下游任务中达到或改进了最先进水平。我们发布了TunBERT预训练模型及用于微调的数据集。

关键词

引用

@article{arxiv.2111.13138,
  title  = {TunBERT: Pretrained Contextualized Text Representation for Tunisian Dialect},
  author = {Abir Messaoudi and Ahmed Cheikhrouhou and Hatem Haddad and Nourchene Ferchichi and Moez BenHajhmida and Abir Korched and Malek Naski and Faten Ghriss and Amine Kerkeni},
  journal= {arXiv preprint arXiv:2111.13138},
  year   = {2021}
}