应用项目反应理论区分人类与生成式AI对多选题评估的响应
人工智能
2024-12-13 v2
摘要
生成式AI正在改变教育格局,引发了关于作弊的重大担忧。尽管多选题在评估中广泛使用,但针对MCQ(多选题)类测试中AI作弊的检测研究几乎未涉足,与此相反,针对文本丰富型学生作品的AI作弊检测已受到广泛关注。本文提出一种基于项目反应理论(IRT)的方法,以解决这一空白。该方法的核心假设是,人工智能与人类智慧呈现不同的响应模式,AI作弊表现为偏离人类响应预期模式的现象。这些偏差通过Person-Fit Statistics进行建模。我们展示了该方法有效地揭示了人类响应与领先聊天机器人(ChatGPT、Claude和Gemini)生成响应之间的差异,但该方法也对数据中AI作弊的程度敏感。此外,我们表明不同聊天机器人在推理轮廓方面存在差异。我们的工作提供了IRT应用于识别MCQ类评估中AI作弊的理论基础和实证证据。
引用
@article{arxiv.2412.02713,
title = {Applying IRT to Distinguish Between Human and Generative AI Responses to Multiple-Choice Assessments},
author = {Alona Strugatski and Giora Alexandron},
journal= {arXiv preprint arXiv:2412.02713},
year = {2024}
}
备注
PRE-PRINT VERSION Accepted to The 15th International Learning Analytics and Knowledge Conference (LAK25)