中文

土耳其 NLP 评估标准:TR-MMLU 大型语言模型评估基准

计算与语言 2025-01-07 v2

摘要

语言模型在理解和生成人类语言方面取得了显著进展,跨越广泛的应用场景取得了显著成功。然而,评估这些模型仍是一个重大挑战,尤其是对于资源受限的土耳其语等语言。为此,我们引入土耳其 MMLU(TR-MMLU)基准,这是一个综合性的评估框架,旨在评估大型语言模型(LLM)在土耳其语中的语言和概念能力。TR-MMLU 由来自 28 万个问题中挑选出的 6200 个多选题组成,这些问题涵盖 67 个学科、超过 800 个土耳其教育体系中的主题。该基准提供了一个透明、可复现且具有文化相关性的工具,用于评估模型性能。它为土耳其 NLP 研究提供了标准框架,使我们能够对 LLM 在处理土耳其文本方面的能力进行详细分析,从而促进更健壮、更准确的语言模型的开发。本研究评估了 TR-MMLU 上最新的 LLM,提供了关于其在土耳其语特定任务方面的优势和局限性的见解。我们的发现揭示了如分词和微调策略等关键挑战,并突显了模型设计方面的改进领域。通过为土耳其语言模型评估设定新标准,TR-MMLU 旨在激发未来创新,支持土耳其 NLP 研究的进步。

关键词

引用

@article{arxiv.2501.00593,
  title  = {Setting Standards in Turkish NLP: TR-MMLU for Large Language Model Evaluation},
  author = {M. Ali Bayram and Ali Arda Fincan and Ahmet Semih Gümüş and Banu Diri and Savaş Yıldırım and Öner Aytaş},
  journal= {arXiv preprint arXiv:2501.00593},
  year   = {2025}
}

备注

6 pages, 2 tables, submitted to arXiv for review. Includes a comprehensive evaluation framework for Turkish NLP tasks and state-of-the-art LLM evaluations