面向巴尔蒙与北欧语言的多语言 LLM 评估:以立陶宛历史为例
计算与语言
2025-01-17 v1 人工智能
摘要
本 work 评估了多语言大语言模型(LLM)在立陶宛语及通用历史知识方面的表现,基于多选问答任务。模型在翻译成巴尔蒙语、北欧语及其他语言(英语、乌克兰语、阿拉伯语)的立陶宛国家与通用历史问题数据集上进行测试,以评估知识在文化和历史相关组之间的共享情况。我们评估了 GPT-4o、LLaMa3.1 8b 和 70b、QWEN2.5 7b 和 72b、Mistral Nemo 12b、LLaMa3 8b、Mistral 7b、LLaMa3.2 3b 以及北欧微调模型(GPT-SW3 和 LLaMa3 8b)。我们的结果表明,GPT-4o 在所有语言组中均一致领先,巴尔蒙语和北欧语略优于其他语言。较大的开源模型如 QWEN2.5 72b 和 LLaMa3.1 70b 表现良好,但在与巴尔蒙语的对齐方面较弱。较小的模型(Mistral Nemo 12b、LLaMa3.2 3b、QWEN 7B、LLaMa3.1 8B 和 LLaMa3 8b)在与立陶宛语相关的对齐方面存在差距,但在北欧语和其他语言方面表现更佳。北欧微调模型未超过多语言模型,表明共享的文化或历史背景本身并不足以保证更好的性能。
引用
@article{arxiv.2501.09154,
title = {Towards Multilingual LLM Evaluation for Baltic and Nordic languages: A study on Lithuanian History},
author = {Yevhen Kostiuk and Oxana Vitman and Łukasz Gagała and Artur Kiulian},
journal= {arXiv preprint arXiv:2501.09154},
year = {2025}
}