中文

基于Transformer集成的德语句子自动可读性评估

计算与语言 2022-09-12 v1

摘要

可靠的自动可读性评估方法有可能影响从机器翻译到自主学习的广泛领域。近来,德语大语言模型(如GBERT和GPT-2-Wechsel)已经可用,使得开发基于深度学习的方案成为可能,有望进一步改进自动可读性评估。在本文中,我们研究了微调GBERT和GPT-2-Wechsel模型集成可靠预测德语句子可读性的能力。我们将这些模型与语言特征相结合,并研究了预测性能对集成规模与组成的依赖关系。GBERT与GPT-2-Wechsel的混合集成表现优于仅由GBERT或GPT-2-Wechsel模型组成的同等规模集成。我们的模型在GermEval 2022文本复杂度评估共享任务中的德语句子数据上进行了评估。在样本外数据上,我们的最佳集成实现了0.435的均方根误差。

关键词

引用

@article{arxiv.2209.04299,
  title  = {Automatic Readability Assessment of German Sentences with Transformer Ensembles},
  author = {Patrick Gustav Blaneck and Tobias Bornheim and Niklas Grieger and Stephan Bialonski},
  journal= {arXiv preprint arXiv:2209.04299},
  year   = {2022}
}

备注

6 pages, 3 figures