中文

大型语言模型在教育领域的多语言性能偏差

计算与语言 2025-08-06 v2 人工智能

摘要

大型语言模型(LLMs)在教育环境中的应用日益广泛。这些应用已超越英语范畴,尽管当前的LLMs仍主要以英语为中心。在本研究中,我们探究其在非英语语言教育环境中的使用是否合理。我们在四项教育任务上评估了主流LLMs的性能:识别学生错误概念、提供针对性反馈、交互式辅导以及翻译评分,涵盖英语以外的八种语言(普通话、印地语、阿拉伯语、德语、波斯语、泰卢固语、乌克兰语、捷克语)。我们发现,这些任务的表现与训练数据中相应语言的占比存在一定相关性,低资源语言的任务表现较差。尽管模型在大多数语言下表现尚可,但相较于英语的频繁性能下降仍十分显著。因此,我们建议从业者在部署前,务必先验证LLM在目标语言及其教育任务中是否表现良好。

关键词

引用

@article{arxiv.2504.17720,
  title  = {Multilingual Performance Biases of Large Language Models in Education},
  author = {Vansh Gupta and Sankalan Pal Chowdhury and Vilém Zouhar and Donya Rooein and Mrinmaya Sachan},
  journal= {arXiv preprint arXiv:2504.17720},
  year   = {2025}
}