中文

基于 LLM 的代数competence 在多阶段区块编码任务中的 Rubric 化评估:设计与现场评估

计算机与社会 2025-10-09 v1 人工智能

摘要

随着在线教育平台的扩展,对评估方法的需求日益增长,这些方法不仅要衡量答案的准确性,还要捕捉学生认知过程深度,同时与课程目标相吻合。本研究提出并评估了一个由大型语言模型 (LLM) 提供动力的基于 Rubric 的评估框架,用于衡量代数competence 和真实世界情境下的区块编码任务。该问题集由数学教育专家设计,与五个预定义的 Rubric 维度对应,使 LLM 能够评估学生问题解决过程的正确性和质量。该系统在一个记录所有中间响应并运用 LLM 进行 Rubric 对齐 achievement 评估的在线平台上实现。为检验所提出框架的实际有效性,我们进行了一项现场研究,涉及 42 名中学生参与多阶段二次方程任务的区块编码。该研究整合了学习者自我评估和专家评分,以基准系统输出。LLM-based Rubric 评估与专家判断显示出强一致性,并持续产生 Rubric 对齐的、以过程为导向的反馈。这些结果表明,融入 LLM-driven Rubric 评估至在线数学和 STEM 教育平台具有有效性和可扩展性。

关键词

引用

@article{arxiv.2510.06253,
  title  = {LLM-Driven Rubric-Based Assessment of Algebraic Competence in Multi-Stage Block Coding Tasks with Design and Field Evaluation},
  author = {Yong Oh Lee and Byeonghun Bang and Sejun Oh},
  journal= {arXiv preprint arXiv:2510.06253},
  year   = {2025}
}