中文

LLM 已是优秀导师:基于无训练提示优化的数学教学

计算与语言 2026-05-27 v1 机器学习

摘要

通常需要基于 RL 的训练和多 GPU 基础设施才能将 LLM 对齐用于数学教学。我们探讨是否可以通过仅优化系统提示(通过 API 调用)实现无训练提示优化,作为实际替代方案。我们改编了 7 种已发布方法,提出 5 种教育专业方法,在 5 种情景下评估这 12 种方法,测试于 2 个 OOD benchmark 套件。所有 12 种最佳配置均超越最强的 RL 训练基准(R_total = 0.633),我们的 ParetoGrad 在后测解答率、漏洞控制和帮助fulness 之间实现最佳 Pareto 均衡,而非在单一维度上占据优势。行为分析通过 82 类教育代码词典揭示,无训练方法在教学知识模式上的使用率是 RL 训练模型的 2-3 倍,同时伴随约 10 个百分点的意图层次 scaffolding 减少。我们还发现任务相关的推理模式效应在无训练和基于 RL 的方法中均一致。我们的做法 enables 使用仅提示即可高效开发出在教育方面对齐的 LLM 导师,且计算资源最少。

关键词

引用

@article{arxiv.2605.27088,
  title  = {LLMs Are Already Good Tutors: Training-Free Prompt Optimization for Pedagogical Math Tutoring},
  author = {Unggi Lee and Minchul Shin and Yeil Jeong and Sookbun Lee and Jeongsu Moon and Kyungtae Joo and Eunjoo Lee and Hoilym Kwon},
  journal= {arXiv preprint arXiv:2605.27088},
  year   = {2026}
}

备注

17 pages, 5 figures