中文

Evalita-LLM:在意大利语上对大型语言模型进行基准测试

计算与语言 2025-02-05 v1

摘要

我们描述了 Evalita-LLM,一个旨在评估大型语言模型(LLM)在意大利语任务上表现的新基准。Evalita-LLM 的显著和创新特征如下: 所有任务均为原生意大利语,避免了从意大利语翻译的问题及潜在的文化偏见; 除了成熟的选定任务外,该基准还包含生成式任务,从而实现与 LLM 更自然的交互; 所有任务均使用多个提示进行评估,以此减轻模型对特定提示的敏感性,从而实现更公平、客观的评估。我们提出了一种迭代方法,其中候选任务和候选提示是针对一组用于开发的 LLM 进行验证的。我们报告了基准开发阶段的实验结果,并提供了多个最先进 LLM 的性能统计数据。

关键词

引用

@article{arxiv.2502.02289,
  title  = {Evalita-LLM: Benchmarking Large Language Models on Italian},
  author = {Bernardo Magnini and Roberto Zanoli and Michele Resta and Martin Cimmino and Paolo Albano and Marco Madeddu and Viviana Patti},
  journal= {arXiv preprint arXiv:2502.02289},
  year   = {2025}
}

备注

42 pages, 1 figure, 32 tables