中文

DUMB:一个用于智能评估荷兰语模型的基准

计算与语言 2023-10-16 v2

摘要

我们介绍了荷兰语模型基准 DUMB(Dutch Model Benchmark)。该基准包含一组涵盖低、中、高资源任务的多样化数据集。总计九项任务中有四项此前无荷兰语版本可用。我们未采用跨任务平均得分,而是提出相对错误率缩减(RER),将语言模型的 DUMB 表现与一个强基线比较,即便在未来评估不同语言模型集合时也可参考该基线。通过对 14 个预训练语言模型(单语与多语、不同规模)的比较,我们评估了基准任务的内部一致性,以及可能促成高性能的因素。结果表明当前荷兰语单语模型表现欠佳,并建议以其他架构与预训练目标训练更大的荷兰语模型。目前,最高性能由 DeBERTaV3(large)、XLM-R(large)和 mDeBERTaV3(base)取得。除凸显训练更大荷兰语模型的最佳策略外,DUMB 将促进荷兰语研究的进一步开展。公开排行榜见 https://dumbench.nl。

关键词

引用

@article{arxiv.2305.13026,
  title  = {DUMB: A Benchmark for Smart Evaluation of Dutch Models},
  author = {Wietse de Vries and Martijn Wieling and Malvina Nissim},
  journal= {arXiv preprint arXiv:2305.13026},
  year   = {2023}
}

备注

EMNLP 2023 camera-ready