CPG-EVAL:评估大型语言模型中文教学语法能力的多层次基准
计算与语言
2025-04-21 v1 人工智能
计算机与社会
人机交互
社会与信息网络
摘要
目的:随着ChatGPT等大型语言模型(LLM)的快速涌现,对外语教育产生了重大影响,但其教学语法能力仍未得到充分评估。本文引入CPG-EVAL,首个专为评估外语教学中大型语言模型的教学语法知识而设计的基准测试。方法:本基准包含五个任务,用于评估语法识别、精细语法区分、范畴鉴别及抗干扰能力。发现:规模较小的模型在单语言实例任务中可取得成功,但在多实例任务和干扰性实例方面表现不足。规模较大的模型对干扰抗性更好,但在准确率方面仍有显著提升空间。评估表明,需更好的指令对齐和更严格的基准,才能有效指导大型语言模型在教育情境中的部署。价值:本研究提供了首个专门、理论驱动的多层次基准框架,用于系统评估大型语言模型在中文教学中的教学语法能力。CPG-EVAL不仅为教育者、政策制定者和模型开发者提供实证见解,帮助更好地把握AI在教育场景中的当前能力,也为改进模型对齐、提升教育适用性以及确保在外语教学中合理集成大型语言模型的决策提供了基础。
引用
@article{arxiv.2504.13261,
title = {CPG-EVAL: A Multi-Tiered Benchmark for Evaluating the Chinese Pedagogical Grammar Competence of Large Language Models},
author = {Dong Wang},
journal= {arXiv preprint arXiv:2504.13261},
year = {2025}
}
备注
12 pages, 1 figure, 3 tables