您的学生并未像您期望的那样使用 LLM
计算与语言
2026-04-28 v1 计算机与社会
人机交互
摘要
教育 NLP 系统的评估通常依赖参与度指标和满意度调查,这些指标最多只能作为实现教学目标的代理指标。我们引入六个计算指标,用于自动化评估学生与 AI 对话的教学一致性。通过分析 500 场课程中 12,650 条消息,我们对这些指标进行了验证。使用这些指标,我们识别出一种根本性的偏差:教育者设计的对话式辅导系统旨在促进持续的学习对话,但学生主要将其用于答案提取。部署环境是使用模式的最强预测因子,甚至超过学生偏好或系统设计:当 AI 工具为可选时,使用集中在截止日期附近;当集成到课程结构中时,学生会请求解决字面化赋值问题的解答。整体对话评估无法捕捉这些逐轮的模式。我们的指标将使构建教育对话系统的研究者能够衡量他们是否实现了教学目标。
引用
@article{arxiv.2604.23486,
title = {Your Students Don't Use LLMs Like You Wish They Did},
author = {Sebastian Kobler and Matthew Clemson and Angela Sun and Jonathan K. Kummerfeld},
journal= {arXiv preprint arXiv:2604.23486},
year = {2026}
}
备注
To appear at ACL 2026 (Main Conference)