此路可行:设计与构建 LEPISZCZE——一个面向波兰语的综合性 NLP 基准
计算与语言
2022-11-24 v1 信息检索
机器学习
摘要
用于训练越来越大的语言模型的计算资源与数据的可用性,增加了对稳健方法来基准测试语言模型训练真实进展的需求。近年来,英语标准化基准测试取得了显著进展。GLUE、SuperGLUE 或 KILT 等基准已成为比较大语言模型的事实标准工具。遵循为其他语言复刻 GLUE 的趋势,波兰语基准 KLEJ 已发布。在本文中,我们评估了低资源语言基准测试的进展。我们注意到仅有少数语言拥有此类综合性基准。我们还注意到资源丰富的英语/中文与其他地区之间由基准评估的任务数量存在差距。在本文中,我们介绍了 LEPISZCZE(波兰语中意为 glew,即 glue 的中古英语前身),这是一个面向波兰语 NLP 的新的综合性基准,具有多样化的任务以及高质量的基准操作化。我们在设计 LEPISZCZE 时考虑了灵活性。包含新模型、数据集和任务尽可能简单,同时仍提供数据版本控制与模型追踪。在基准的首次运行中,我们基于五个最新的波兰语 LM 测试了 13 个实验(任务与数据集对)。我们使用了波兰语基准中的五个数据集并新增了八个新数据集。除 LEPISZCZE 外,本文的主要贡献在于,我们提供了创建波兰语基准过程中的见解与经验,作为为其他低资源语言设计类似基准的蓝图。
引用
@article{arxiv.2211.13112,
title = {This is the way: designing and compiling LEPISZCZE, a comprehensive NLP benchmark for Polish},
author = {Łukasz Augustyniak and Kamil Tagowski and Albert Sawczyn and Denis Janiak and Roman Bartusiak and Adrian Szymczak and Marcin Wątroba and Arkadiusz Janz and Piotr Szymański and Mikołaj Morzy and Tomasz Kajdanowicz and Maciej Piasecki},
journal= {arXiv preprint arXiv:2211.13112},
year = {2022}
}
备注
10 pages, 8 pages appendix