NorEval:挪威语语言理解与生成评估基准
计算与语言
2025-06-06 v2 人工智能
摘要
本文介绍 NorEval,一套全新的、综合性的评估套件,用于对挪威语生成式语言模型(LMs)进行大规模标准化基准测试。NorEval 包含 24 个高质量的人工创建数据集——其中五个是从零创建的。与现有的挪威语基准不同,NorEval 涵盖了广泛的任务类别,针对挪威语语言理解和生成,建立了人类基线,并关注两个官方书面挪威语标准:Bokmål 和 Nynorsk。我们将所有数据集和一系列100多个人工编写的提示整合到 LM Evaluation Harness 中,确保灵活且可重复的评估。我们描述了 NorEval 的设计,并展示了对 19 个开源预训练和指令调优语言模型进行 various 场景下的基准测试结果。我们的基准、评估框架和标注材料均公开可用。
引用
@article{arxiv.2504.07749,
title = {NorEval: A Norwegian Language Understanding and Generation Evaluation Benchmark},
author = {Vladislav Mikhailov and Tita Enstad and David Samuel and Hans Christian Farsethås and Andrey Kutuzov and Erik Velldal and Lilja Øvrelid},
journal= {arXiv preprint arXiv:2504.07749},
year = {2025}
}
备注
Accepted for Findings of the Association for Computational Linguistics: ACL 2025