生成式 AI 时代多选题未来?一种后测试唯一随机对照实验
人机交互
2024-12-16 v1 人工智能
摘要
多选题(Multiple-choice questions, MCQs)作为有效学习工具的作用以往研究中存在争议。尽管 MCQs 因易于批改而广泛使用,但开放式问题因大型语言模型(LLMs)在自动评分方面的进步而日益被用于教学。本研究评估了 MCQs 的有效性是否相对于开放式问题,在学习方面各自以及组合使用效果如何。这些活动嵌入于六个辅导课程中,主题为倡导。我们采用后测试唯一随机对照设计,比较 234 名辅导员(790 课时完成情况)在三种条件下的表现:仅 MCQs、仅开放式问题以及两者的组合。我们发现三种条件在后测试中不存在显著学习差异,但 MCQs 条件下的辅导员完成指令时间显著更短。这些发现表明,当实践时间有限时,MCQs 与开放式任务相当且更高效。为进一步提高效率,我们使用 GPT-4o 和 GPT-4-turbo 对开放式回答进行自动评分。GPT 模型在低风险评估方面表现出色,尽管需进一步研究以推广其应用。本研究提供了一套课时日志数据、人工标注评分标准以及 LLM 提示词,旨在促进透明度和可重复性。
引用
@article{arxiv.2412.10267,
title = {Does Multiple Choice Have a Future in the Age of Generative AI? A Posttest-only RCT},
author = {Danielle R. Thomas and Conrad Borchers and Sanjit Kakarla and Jionghao Lin and Shambhavi Bhushan and Boyuan Guo and Erin Gatz and Kenneth R. Koedinger},
journal= {arXiv preprint arXiv:2412.10267},
year = {2024}
}
备注
Full research paper accepted to Learning Analytics and Knowledge (LAK 2025)