利用大语言模型导师逐步验证与纠正学生推理错误
计算与语言
2024-07-15 v1 人工智能
机器学习
摘要
大语言模型(LLM)为向所有人推广高质量个性化教育提供了机会。实现这一目标的一个有前景的方法是构建对话辅导模型,以支架式地辅助学生解决问题。然而,尽管现有的 LLM 在解答推理问题方面表现良好,但它们难以精确检测学生的错误并针对这些错误定制反馈。受现实教学实践中教师识别学生错误并据此定制回应的启发,我们专注于验证学生的解题过程,并展示了基于此类验证如何提高辅导回复生成的总体质量。我们收集了一个包含 1000 个逐步数学推理链的数据集,其中标注了教师确定的第一个错误步骤。我们通过实验表明,对于当前模型而言,找到学生解题过程中的错误具有挑战性。我们提出并评估了几种用于检测这些错误的验证器。通过自动评估和人工评估,我们表明,与现有基线相比,学生解题过程验证器引导生成模型产生高度针对学生错误的回复,这些回复更正确且幻觉更少。
引用
@article{arxiv.2407.09136,
title = {Stepwise Verification and Remediation of Student Reasoning Errors with Large Language Model Tutors},
author = {Nico Daheim and Jakub Macina and Manu Kapur and Iryna Gurevych and Mrinmaya Sachan},
journal= {arXiv preprint arXiv:2407.09136},
year = {2024}
}
备注
Preprint. Nico Daheim and Jakub Macina contributed equally. Code and dataset can be found under: https://github.com/eth-lre/verify-then-generate