中文

基于 CamemBERTa 的数据高效法语语言建模

计算与语言 2023-06-05 v1

摘要

自然语言处理(NLP)的最新进展显著提升了语言模型在多种任务上的性能。尽管这些进展很大程度上由大量数据与算力的可用性所驱动,它们也受益于更优训练方法与架构的发展。本文介绍 CamemBERTa,一个基于 DeBERTaV3 架构与训练目标构建的法语 DeBERTa 模型。我们在多种法语下游任务与数据集上评估模型性能,包括问答、词性标注、依存句法分析、命名实体识别以及 FLUE 基准,并与法语最先进单语模型 CamemBERT 进行比较。结果表明,在同等训练 token 量下,本模型在大多数任务上优于以 MLM 训练的 BERT 类模型。此外,尽管仅使用 CamemBERT 输入 token 总量的 30% 进行训练,新模型在下游任务上仍达到与之相当或更优的性能。除实验结果外,我们公开发布 CamemBERTa 的权重与代码实现,使其成为原论文之外首个公开可用的 DeBERTaV3 模型,也是首个公开可用的 DeBERTaV3 训练目标实现。https://gitlab.inria.fr/almanach/CamemBERTa

关键词

引用

@article{arxiv.2306.01497,
  title  = {Data-Efficient French Language Modeling with CamemBERTa},
  author = {Wissam Antoun and Benoît Sagot and Djamé Seddah},
  journal= {arXiv preprint arXiv:2306.01497},
  year   = {2023}
}

备注

Findings of the Association for Computational Linguistics: ACL 2023, Toronto, Canda