NLEBench+NorGLM:面向挪威语生成式语言模型的综合实证分析与基准数据集
计算与语言
2024-10-02 v2
摘要
挪威语仅有 500 万使用者,在 NLP 任务中最引人注目的突破中代表性不足。据我们所知,在本文撰写过程中,尚未对现有语言模型 (LM) 在挪威语生成任务上进行过全面评估。为了填补这一空白,我们 1) 整理了现有的挪威语数据集,并预训练了 4 个参数规模和架构各异的挪威语开放语言模型,统称为 NorGLM;2) 引入了一个综合基准 NLEBench,用于评估挪威语的自然语言生成能力,涵盖翻译和人工标注。基于该研究,我们发现:1) 主流的英语主导 LM GPT-3.5 在理解挪威语语境方面能力有限;2) 当预训练数据集规模受限时,模型参数规模的增加对下游任务性能的影响有限;3) 较小的模型也通过思维链展示了推理能力;4) 包含协同任务的多任务数据集可用于验证 LLM 在自然语言理解上的泛化能力,同时测试这些 NLP 任务的相互关联性。我们以 CC BY-NC 4.0 许可共享了我们的资源和代码以供复现。
引用
@article{arxiv.2312.01314,
title = {NLEBench+NorGLM: A Comprehensive Empirical Analysis and Benchmark Dataset for Generative Language Models in Norwegian},
author = {Peng Liu and Lemei Zhang and Terje Farup and Even W. Lauvrak and Jon Espen Ingvaldsen and Simen Eide and Jon Atle Gulla and Zhirong Yang},
journal= {arXiv preprint arXiv:2312.01314},
year = {2024}
}
备注
Accepted at EMNLP 2024 Main Conference. Code available at https://github.com/Smartmedia-AI/NorGLM/