中文

基于 LLM 专家与学生智能体的高质量编程任务合成

人工智能 2025-08-28 v2 计算机与社会

摘要

生成式 AI 正通过实现个性化内容和反馈,变革计算教育领域。我们调查其在为学生提供高质量编程任务方面的能力。尽管在任务生成方面取得了令人鼓舞的进展,但 AI 生成的任务与专家创建任务之间仍存在质量差距。AI 生成的任务可能无法与目标编程概念保持一致,学生可能难以理解,或包含关键性错误(如不正确的测试用例)。现有工作通常需要人类教师进行验证。我们通过引入 PyTaskSyn,一种新型合成技术来解决这些挑战。该技术首先生成编程任务,然后决定其是否满足 certain quality criteria 以供学生使用。关键思想是将整个过程分解为由专家智能体和学生智能体在多个阶段完成,其中分别使用强模型和较弱模型进行模拟。在大量评估后,我们展示了 PyTaskSyn 在基线技术之上显著提升了任务质量,并阐明了每种专用智能体在验证管道中所起的重要性。此外,我们公开了基于 PyTaskSyn 的 Web 应用,进行了用户研究,表明 PyTaskSyn 能为学生提供质量与专家设计的相当高的编程任务,同时降低了工作量和成本,且比在线资源中可获得的编程任务更具吸引力。

关键词

引用

@article{arxiv.2504.07655,
  title  = {Synthesizing High-Quality Programming Tasks with LLM-based Expert and Student Agents},
  author = {Manh Hung Nguyen and Victor-Alexandru Pădurean and Alkis Gotovos and Sebastian Tschiatschek and Adish Singla},
  journal= {arXiv preprint arXiv:2504.07655},
  year   = {2025}
}

备注

AIED'25 paper