教育内容中 AI 生成文本检测:基于机器学习与可解释 AI 的学术诚信
计算与语言
2025-01-07 v1 人工智能
计算机与社会
摘要
本研究旨在通过先进技术提供工具来检测学生作品中的 AI 生成内容,以提升学术诚信。研究结果促进了透明度和问责制,帮助教育者维持伦理标准,支持 AI 在教育领域的负责任融合。本工作的关键贡献是生成 CyberHumanAI 数据集,其中包含 1000 条观察数据,其中 500 条由人类撰写,另 500 条由 ChatGPT 生成。我们在 CyberHumanAI 数据集上评估了各种机器学习 (ML) 和深度学习 (DL) 算法,比较了大型语言模型 (LLM) (即 ChatGPT) 生成的内容与人类撰写内容。结果表明,传统机器学习算法,特别是 XGBoost 和 Random Forest,分别实现了 83% 和 81% 的准确率。结果还显示,对较短内容的分类似乎比对较长内容的分类更具挑战性。进一步地,我们使用可解释人工智能 (XAI) 识别影响 ML 模型预测的判别特征,其中人类撰写的内容倾向于使用实用语言(例如 use 和 allow)。相比之下,AI 生成的文本以更抽象和正式的术语为特征(例如 realm 和 employ)。最后,我们与 GPTZero 进行了比较分析,表明该窄化聚焦、简单且微调的模型可以超越像 GPTZero 这样的通用系统。该提议模型在分类纯 AI、纯人类和混合类别时,准确率约为 77.5%,而 GPTZero 的准确率为 48.5%。GPTZero 在面对具有挑战性和小内容案例时,倾向于将其分类为混合或未识别,而我们提议的模型在三个类别之间表现更为均衡。
引用
@article{arxiv.2501.03203,
title = {Detecting AI-Generated Text in Educational Content: Leveraging Machine Learning and Explainable AI for Academic Integrity},
author = {Ayat A. Najjar and Huthaifa I. Ashqar and Omar A. Darwish and Eman Hammad},
journal= {arXiv preprint arXiv:2501.03203},
year = {2025}
}