中文

ScandEval:一个斯堪的纳维亚自然语言处理基准平台

计算与语言 2023-04-04 v1 机器学习

摘要

本文介绍了一个斯堪的纳维亚基准测试平台 ScandEval,该平台可在四项不同的斯堪的纳维亚语言任务上对任意预训练模型进行基准测试。其中两项任务(语言可接受性与问答)所使用的数据集是全新的。我们开发并发布了一个 Python 包及命令行接口 scandeval,它可对已上传至 Hugging Face Hub 的任意模型进行可复现的基准测试。使用该包,我们对 100 多个斯堪的纳维亚或多语言模型进行了基准测试,并在一个交互式在线排行榜中展示了这些结果,同时对结果进行了分析。分析表明,在大陆斯堪的纳维亚语言(丹麦语、瑞典语和挪威语)之间存在显著的跨语言迁移,而大陆斯堪的纳维亚语言组与岛屿斯堪的纳维亚语言组(冰岛语和法罗语)之间的跨语言迁移十分有限。基准测试结果还表明,挪威、瑞典和丹麦在语言技术上的投入已催生出在性能上大幅超越 XLM-RoBERTa 和 mDeBERTaV3 等大规模多语言模型的语言模型。我们发布了该包与排行榜的源代码。

关键词

引用

@article{arxiv.2304.00906,
  title  = {ScandEval: A Benchmark for Scandinavian Natural Language Processing},
  author = {Dan Saattrup Nielsen},
  journal= {arXiv preprint arXiv:2304.00906},
  year   = {2023}
}

备注

17 pages, 11 figures, camera-ready NoDaLiDa 2023 submission