中文

MM-Eval:面向大语言模型中现代蒙古语评测的分层基准

计算与语言 2024-11-15 v1 人工智能

摘要

大语言模型(LLM)在高资源语言上表现优异,但在蒙古语等低资源语言上却面临显著挑战。本文将能力划分为语言能力(句法与语义)和认知能力(知识与推理),以系统评测这些领域。为此,我们基于《现代蒙古语教材 I》并融合 WebQSP 与 MGSM 数据集,开发了专用数据集 MM-Eval。在 Qwen2-7B-Instruct、GLM4-9b-chat、Llama3.1-8B-Instruct、GPT-4 与 DeepseekV2.5 等模型上的初步实验表明:1) 所有模型在句法任务上的表现优于语义任务,凸显了深层语言理解方面的差距;2) 知识任务呈现中度下降,提示模型可将高资源语境中的通用知识迁移至低资源语境。MM-Eval 的发布——包含 569 个句法、677 个语义、344 个知识和 250 个推理任务——为推进蒙古语等低资源语言的 NLP 与 LLM 研究提供了宝贵见解。数据集可在 https://github.com/joenahm/MM-Eval 获取。

关键词

引用

@article{arxiv.2411.09492,
  title  = {MM-Eval: A Hierarchical Benchmark for Modern Mongolian Evaluation in LLMs},
  author = {Mengyuan Zhang and Ruihui Wang and Bo Xia and Yuan Sun and Xiaobing Zhao},
  journal= {arXiv preprint arXiv:2411.09492},
  year   = {2024}
}