GottBERT:一个纯德语语言模型
计算与语言
2025-06-13 v1 机器学习
摘要
近来,预训练语言模型推动了自然语言处理(NLP)领域的发展。Transformer 双向编码器(Bidirectional Encoders for Transformers, BERT)及其优化版本 RoBERTa 的引入产生了显著影响,并提升了预训练模型的重要性。首先,该领域的研究主要从英语数据开始,随后出现了用多语言文本语料训练的模型。然而,当前研究表明多语言模型劣于单语模型。目前尚未发布德语单语 RoBERTa 模型,我们在本工作中提出该模型(GottBERT)。我们使用 OSCAR 数据集的德语部分作为文本语料。在评估中,我们将其在 Conll 2003 和 GermEval 2014 两个命名实体识别(Named Entity Recognition, NER)任务以及 GermEval 2018(细粒度与粗粒度)和 GNAD 文本分类任务上的性能与现有德语单语 BERT 模型及两个多语言模型进行比较。GottBERT 使用 fairseq 基于原始 RoBERTa 模型进行预训练。所有下游任务均使用取自德语 BERT 基准的超参数预设进行训练。实验使用 FARM 搭建。性能通过 分数衡量。GottBERT 成功地在 256 核 TPU pod 上使用 RoBERTa BASE 架构进行了预训练。即使未进行广泛的超参数优化,在所有 NER 任务和一个文本分类任务中,GottBERT 已优于所有其他受测的德语和多语言模型。为支持德语 NLP 领域,我们以 AGPLv3 许可证发布 GottBERT。
引用
@article{arxiv.2012.02110,
title = {GottBERT: a pure German Language Model},
author = {Raphael Scheible and Fabian Thomczyk and Patric Tippmann and Victor Jaravine and Martin Boeker},
journal= {arXiv preprint arXiv:2012.02110},
year = {2025}
}