面向 AI 辅导的数学错误纠正奖励建模
计算与语言
2026-03-26 v1
摘要
评估 AI 辅导器的教育学质量仍具有挑战性:标准 NLG 指标无法判断响应是否识别错误、是否对推理进行支架化,或是否泄露答案。对于错误纠正任务,我们从人类两两偏好中提炼出教育学层次结构,并合成最小对比响应对,这些响应在关键方面(例如错误识别与位置、针对性、支架化、可操作性、清晰度和连贯性)上存在差异。我们开发并发布了基于加权求和排名的 Bradley-Terry 偏好模型,这些排名我们从 MRBench、合成对及数据组合中自动创建。仅使用合成数据,我们最好的模型在人类偏好测试中达到 0.69 的两两准确率,将加权求和数据与针对性合成组合并可将准确率提升至 0.74,超过了使用仅 0.5B 参数背板的更大通用奖励模型。
引用
@article{arxiv.2603.24375,
title = {Towards Reward Modeling for AI Tutors in Math Mistake Remediation},
author = {Kseniia Petukhova and Ekaterina Kochmar},
journal= {arXiv preprint arXiv:2603.24375},
year = {2026}
}