中文

利用数据增强与偏好优化改进苏格拉底式问题生成

计算与语言 2024-04-22 v3 计算机与社会 机器学习

摘要

苏格拉底法是一种引导学生独立解决问题而不直接揭示答案的方法。尽管该方法已被证明能显著改善学生的学习成果,但对教师而言仍是一项复杂且劳动密集型的任务。大语言模型(LLM)可通过自动生成苏格拉底式问题来 augment 人力投入。然而,现有涉及提示这些 LLM 的方法有时会产生无效输出,例如直接揭示问题答案、提供无关问题或过早提问。为缓解此问题,受基于 AI 反馈的强化学习(RLAIF)启发,我们首先提出一种数据增强方法,用特定方式无效的问题丰富现有的苏格拉底提问数据集。接着,我们提出一种方法,利用直接偏好优化(DPO)优化 LLama 2 等开源 LLM,使其偏好真实问题而非生成的无效问题。我们在学生代码调试的苏格拉底问题数据集上的实验表明,经 DPO 优化的 7B LLama 2 模型能有效避免生成无效问题,从而优于现有的最先进(SOTA)提示方法。

关键词

引用

@article{arxiv.2403.00199,
  title  = {Improving Socratic Question Generation using Data Augmentation and Preference Optimization},
  author = {Nischal Ashok Kumar and Andrew Lan},
  journal= {arXiv preprint arXiv:2403.00199},
  year   = {2024}
}

备注

Published at the 19th BEA Workshop co-located with NAACL-2024