基于知识组件的AI助手评估方法
计算机与社会
2024-06-11 v1 人工智能
摘要
我们评估了一个由大型语言模型GPT-4驱动的CS1编程作业自动提示生成器。该系统提供自然语言指导,帮助学生改进其不正确的短编程练习解决方案。每当学生未通过测试用例时,可以请求提示。我们的评估针对三个研究问题:RQ1:提示是否帮助学生改进代码?RQ2:提示在捕捉学生代码中的问题方面效果如何?RQ3:学生解决的问题是否与提示中处理的问题相同?为了定量地回答这些研究问题,我们识别了一组细粒度的知识组件,并确定了哪些组件适用于每个练习、不正确的解决方案以及生成的提示。通过比较两个大型CS1课程的数据,我们发现获取提示有助于学生更快地解决代码问题,提示能够持续捕捉学生代码中最紧迫的错误,并且同时处理多个问题(而非单个错误)的提示更有可能直接促进学生进步。
引用
@article{arxiv.2406.05603,
title = {A Knowledge-Component-Based Methodology for Evaluating AI Assistants},
author = {Laryn Qi and J. D. Zamfirescu-Pereira and Taehan Kim and Björn Hartmann and John DeNero and Narges Norouzi},
journal= {arXiv preprint arXiv:2406.05603},
year = {2024}
}