以西班牙语水平考试为基准评估大型语言模型的表现:通过还是失败?
计算与语言
2024-09-25 v1
摘要
大型语言模型 (LLM) 已在众多领域对回答问题的能力以及不同自然语言理解任务上的表现进行了广泛评估。这些测试通常以英语进行,但大多数 LLM 用户并非英语母语者。因此,有必要分析 LLM 在不同语言层次上的理解能力:从段落到形态素。本文评估了最先进的 LLM 在 TELEIA 基准上的表现,该基准包含类似西班牙语外语考试问题,涵盖阅读理解、词形成分、意义与组合语义以及语法等主题。结果表明,LLM 在理解西班牙语方面表现良好,但在语法competence方面仍远不如 native speaker。
引用
@article{arxiv.2409.15334,
title = {Evaluating Large Language Models with Tests of Spanish as a Foreign Language: Pass or Fail?},
author = {Marina Mayor-Rocher and Nina Melero and Elena Merino-Gómez and María Grandury and Javier Conde and Pedro Reviriego},
journal= {arXiv preprint arXiv:2409.15334},
year = {2024}
}