中文

CamemBERT 2.0:一个更智能的法语语言模型,臻于完美

计算与语言 2024-11-14 v1

摘要

法语语言模型(如 CamemBERT)已在各行业的自然语言处理(NLP)任务中广泛采用,CamemBERT 等模型每月下载量超过 400 万次。然而,这些模型面临时间概念漂移的挑战,过时的训练数据导致性能下降,尤其是在遇到新主题和术语时。这一问题凸显了需要反映当前语言趋势的更新模型。本文介绍了 CamemBERT 基础模型的两个新版本——CamemBERTav2 和 CamemBERTv2,旨在应对这些挑战。CamemBERTav2 基于 DeBERTaV3 架构,采用替换标记检测(RTD)目标以获得更好的上下文理解;CamemBERTv2 则构建于 RoBERTa 之上,使用掩码语言建模(MLM)目标。两个模型均在规模显著更大、更新的数据集上训练,具有更长的上下文长度和更新的分词器,增强了法语的分词性能。我们在通用领域 NLP 任务和特定领域应用(如医疗领域任务)上评估了这些模型的性能,展示了它们在各种用例中的通用性和有效性。结果表明,这些更新的模型大幅超越了其前代模型,使其成为现代 NLP 系统的宝贵工具。我们所有的新模型及中间检查点均在 Huggingface 上公开可用。

关键词

引用

@article{arxiv.2411.08868,
  title  = {CamemBERT 2.0: A Smarter French Language Model Aged to Perfection},
  author = {Wissam Antoun and Francis Kulumba and Rian Touchent and Éric de la Clergerie and Benoît Sagot and Djamé Seddah},
  journal= {arXiv preprint arXiv:2411.08868},
  year   = {2024}
}