GRILE:罗马尼亚语大语言模型的语法推理与解释基准
计算与语言
2025-09-30 v1 计算机与社会
机器学习
摘要
大语言模型(LLMs)已彻底变革了自然语言处理(NLP),然而它们对低资源语言的教学价值仍不明确。我们提出 GRILE(罗马尼亚语语法推理与语言解释),这是首个包含 1151 道多选题的开放基准,题目源自罗马尼亚的高风险考试(全国评估、高中毕业会考、大学入学考试)。GRILE 使我们能够探查七种最先进的多语言及罗马尼亚语专用大语言模型的两项互补能力:(i)选择正确答案,以及(ii)生成语言学上准确的解释。虽然 Gemini 2.5 Pro 达到了 83% 的准确率,但大多数开放权重模型仍低于 65%,并且根据专家评审,其 48% 的解释存在事实或教学上的缺陷。详细的错误分析指出了在形态学以及应用最新 DOOM3 正字法规范方面的系统性弱点。所有数据、代码及公开网页演示均已发布,以促进未来研究。我们的发现揭示了在低资源环境下构建可信赖教育 NLP 的开放挑战,并将 GRILE 确立为可控解释生成与评估的新测试平台。
引用
@article{arxiv.2508.14279,
title = {GRILE: A Benchmark for Grammar Reasoning and Explanation in Romanian LLMs},
author = {Adrian-Marius Dumitran and Alexandra-Mihaela Danila and Angela-Liliana Dumitran},
journal= {arXiv preprint arXiv:2508.14279},
year = {2025}
}
备注
Accepted as long paper @RANLP2025