德语的下一个语言模型
计算与语言
2020-12-04 v4 机器学习
摘要
在这项工作中,我们展示了导致基于 BERT 和 ELECTRA 的德语语言模型 GBERT 和 GELECTRA 创建的系列实验。通过改变输入训练数据、模型规模以及全词掩码(WWM)的存在与否,我们能够在基础和大两种规模的文档分类与命名实体识别(NER)任务集上取得 SOTA 性能。我们在训练这些模型时采用评估驱动的方法,结果表明增加更多数据和使用 WWM 均能提升模型性能。通过与现有德语模型进行基准对比,我们表明这些模型是迄今为止最佳的德语模型。我们训练好的模型将公开提供给研究界。
引用
@article{arxiv.2010.10906,
title = {German's Next Language Model},
author = {Branden Chan and Stefan Schweter and Timo Möller},
journal= {arXiv preprint arXiv:2010.10906},
year = {2020}
}
备注
Accepted by COLING2020