MERA:一个全面的俄语大语言模型评测基准
计算与语言
2024-08-05 v3 人工智能
摘要
过去几年,人工智能研究最显著的进展之一在于基础模型(FMs),其中以语言模型(LMs)的兴起为代表。随着模型规模的增大,语言模型在可衡量方面展现出增强,并发展出新的定性特征。然而,尽管研究者们高度关注且语言模型的应用快速增长,其能力、局限性和相关风险仍需更深入的理解。为解决这些问题,我们推出了一个开放的多模态俄语架构评测(MERA),这是一个面向俄语基础模型的新型指令评测基准。该基准涵盖生成式模型在11个技能领域的21项评测任务,并设计为黑盒测试以确保排除数据泄露。本文介绍了一种在零样本和少样本固定指令设置下评测基础模型和语言模型的方法,该方法可扩展至其他模态。我们提出了评测方法论、用于MERA评估的开源代码库,以及一个带有提交系统的排行榜。我们对开源语言模型进行了基线评测,发现它们仍远落后于人类水平。我们公开发布MERA,以指导未来研究、预见突破性模型特性、标准化评测流程,并应对潜在的社会弊端。
引用
@article{arxiv.2401.04531,
title = {MERA: A Comprehensive LLM Evaluation in Russian},
author = {Alena Fenogenova and Artem Chervyakov and Nikita Martynov and Anastasia Kozlova and Maria Tikhonova and Albina Akhmetgareeva and Anton Emelyanov and Denis Shevelev and Pavel Lebedev and Leonid Sinev and Ulyana Isaeva and Katerina Kolomeytseva and Daniil Moskovskiy and Elizaveta Goncharova and Nikita Savushkin and Polina Mikhailova and Denis Dimitrov and Alexander Panchenko and Sergei Markov},
journal= {arXiv preprint arXiv:2401.04531},
year = {2024}
}
备注
The paper version comparable with the release code v.1.1.0 of the benchmark MERA. ACL-2024 main track camera ready version