中文

单智能体与多智能体 LLM 在自动学生反思评估中的策略比较

机器学习 2025-06-19 v3 计算机与社会

摘要

我们探讨了利用大语言模型(LLM)对开放文本学生反思进行自动评估和学业表现预测的可能性。传统方法评估反思耗时且在教育场景下难以有效扩展。本文我们采用两种评估策略(单智能体与多智能体)和两种提示技术(零样本与少样本),利用 LLM 将学生反思转化为量化分数。我们在跨越三学期、包含 377 名学生、5278 条反思数据的实验中表明,单智能体配合少样本策略在与人类评估匹配度方面取得最佳效果。此外,使用 LLM 评估的反思分数可显著优于基线模型在风险学生识别和成绩预测任务中的表现。这些发现表明 LLM 能够有效自动化反思评估,减轻教育者负担,并为需要额外帮助的学生提供及时支持。我们的工作强调了将先进生成式 AI 技术集成到教育实践中的潜力,以提升学生参与度和学业成功率。

关键词

引用

@article{arxiv.2504.05716,
  title  = {Single-Agent vs. Multi-Agent LLM Strategies for Automated Student Reflection Assessment},
  author = {Gen Li and Li Chen and Cheng Tang and Valdemar Švábenský and Daisuke Deguchi and Takayoshi Yamashita and Atsushi Shimada},
  journal= {arXiv preprint arXiv:2504.05716},
  year   = {2025}
}

备注

Published in Proceedings of the 29th Pacific-Asia Conference on Knowledge Discovery and Data Mining (PAKDD 2025), see https://doi.org/10.1007/978-981-96-8186-0_24