计算教育中 LLM 生成文本的检测:针对 ChatGPT 案例的比较研究
计算与语言
2023-07-17 v1 计算机与社会
摘要
由于大型语言模型(LLMs)近期的改进与广泛可用,它们对教育中的学术诚信构成了严重威胁。现代 LLM 生成文本检测器试图通过为教育者提供评估某文本是否由 LLM 生成的服务来应对该问题。在这项工作中,我们收集了计算机科学学生在 ChatGPT 创建之前的 124 份提交作业,然后生成了 40 份 ChatGPT 提交作业。我们利用这些数据通过准确率、假阳性和鲁棒性等度量评估了八个公开可用的 LLM 生成文本检测器。本工作的目的是告知社区哪些 LLM 生成文本检测器有效、哪些无效,同时也为教育者更好地维护其课程中的学术诚信提供见解。我们的结果发现 CopyLeaks 是最准确的 LLM 生成文本检测器,GPTKit 是减少假阳性最好的 LLM 生成文本检测器,而 GLTR 是最具鲁棒性的 LLM 生成文本检测器。我们也对 GPTZero 产生的 52 个假阳性(共 114 份人类书写提交)表示担忧。最后,我们注意到所有 LLM 生成文本检测器在处理代码、其他语言(英语除外)以及使用转述工具(如 QuillBot)后均准确性下降。现代检测器仍亟需改进,以便提供万全的方案来帮助维护学术诚信。此外,通过促进平滑的 API 集成、提供其特征与模型可理解性的清晰文档以及支持更常用语言,可以提升其可用性。
引用
@article{arxiv.2307.07411,
title = {Detecting LLM-Generated Text in Computing Education: A Comparative Study for ChatGPT Cases},
author = {Michael Sheinman Orenstrakh and Oscar Karnalim and Carlos Anibal Suarez and Michael Liut},
journal= {arXiv preprint arXiv:2307.07411},
year = {2023}
}
备注
18 pages total (16 pages, 2 reference pages). In submission