中文

LookAlike:数学多选题中一致性干扰项生成

机器学习 2025-06-10 v2 人工智能

摘要

大型语言模型(LLMs)越来越多地用于生成多选题(MCQs)的干扰项,尤其是在数学教育领域。然而,现有方法在确保生成干扰项符合常见学生错误模式方面存在局限。我们提出了 LookAlike 方法,通过 preference optimization(preference optimization 保留)改进错误-干扰项一致性。我们的两项主要创新点是:(a) 从模型不一致性中矿采合成偏好对,以及(b) 交替进行监督微调(SFT)和直接偏好优化(DPO),以稳定训练。不同于依赖启发式方法或手动标注偏好数据的先前工作,LookAlike 使用自身生成的不一致性作为次优样本,从而实现可扩展且稳定的训练。我们在真实世界包含 1400 多道数学 MCQs 数据集上的评估显示,LookAlike 在干扰项生成和错误生成上的准确率分别达到 51.6% 和 57.2%(LLM-as-a-judge 评估),显著优于现有最先进方法(45.6% / 47.7%)。这些改进凸显了基于偏好的正则化和不一致性矿采在大规模生成一致性数学 MCQs 干扰项方面的有效性。

关键词

引用

@article{arxiv.2505.01903,
  title  = {LookAlike: Consistent Distractor Generation in Math MCQs},
  author = {Nisarg Parikh and Nigel Fernandez and Alexander Scarlatos and Simon Woodhead and Andrew Lan},
  journal= {arXiv preprint arXiv:2505.01903},
  year   = {2025}
}