Disce aut Deficere:评估LLM在INVALSI意大利语基准上的熟练度
计算与语言
2024-06-26 v1 人工智能
摘要
大语言模型(LLM)的最新进展显著增强了其生成和操控人类语言的能力,突显了其在各种应用中的潜力。评估LLM在英语以外的语言中的表现,对于确保其语言多样性、文化相关性以及在多样化全球背景下的适用性至关重要,从而拓宽其可用性和有效性。我们通过引入一个基于INVALSI测试的结构化基准来应对这一挑战,INVALSI测试是一套旨在衡量意大利全国教育能力的成熟评估体系。我们的研究做出了三项主要贡献:首先,我们将INVALSI基准调整为适用于自动化LLM评估,这涉及对测试格式进行严格调整,以适应自动化处理,同时保留原始测试的精髓。其次,我们提供了对当前LLM的详细评估,为学术界提供了一个关键的参考点。最后,我们以可视化方式将这些模型的性能与人类结果进行了比较。此外,我们邀请研究人员提交他们的模型以进行持续评估,确保该基准保持其作为当前宝贵资源的价值。
引用
@article{arxiv.2406.17535,
title = {Disce aut Deficere: Evaluating LLMs Proficiency on the INVALSI Italian Benchmark},
author = {Fabio Mercorio and Mario Mezzanzanica and Daniele Potertì and Antonio Serino and Andrea Seveso},
journal= {arXiv preprint arXiv:2406.17535},
year = {2024}
}