GeistBERT:为德语 NLP 注入新生活力
计算与语言
2025-07-14 v4
摘要
基于 Transformer 的语言模型进展凸显了面向特定语言在高质量语料库上的预训练优势。在此背景下,德语 NLP 可从针对德语语言特征优化的现代架构和数据集中受益。GeistBERT 通过在多样化语料库上进行增量训练,优化模型在各类 NLP 任务中的性能。我们采用 fairseq 按照 RoBERTa base 配置进行预训练,采用 Whole Word Masking (WWM),并初始化自 GottBERT 的权重。模型在 1.3 TB 的德语语料库上进行训练,采用动态遮蔽和固定的 512 token 序列长度。对于评估,我们在标准下游任务上进行微调,包括命名实体识别 (NER) (CoNLL 2003、GermEval 2014)、文本分类 (GermEval 2018 粗/细粒度、10kGNAD) 和自然语言推理 (German XNLI),采用 分数和准确率作为评估指标。GeistBERT 在所有任务上均取得强劲成绩,位居 base 模型领前列,并在 GermEval 2018 细粒度文本分类中达到新的最佳结果 (SOTA)。它还在分类基准测试中超越了多个更大规模的模型。为支持德语 NLP 研究,我们以 MIT 许可证发布 GeistBERT。
引用
@article{arxiv.2506.11903,
title = {GeistBERT: Breathing Life into German NLP},
author = {Raphael Scheible-Schmitt and Johann Frei},
journal= {arXiv preprint arXiv:2506.11903},
year = {2025}
}