评估教育情境中的LLM文本检测:人类贡献是否影响检测?
计算与语言
2025-08-12 v1 机器学习
摘要
近年来,大型语言模型(LLM)的快速发展及其日益普及的可及性,使得学生轻松自动生成文本的能力大大提升,为教育机构带来了新的挑战。为强制执行学术诚信规范并确保学生的学习,学习分析方法的自动化检测LLM生成文本的功能日益受到关注。本文对不同最新检测方法在教育情境下的性能进行基准测试,引入了新型数据集,即教育中的生成性作文检测数据集(Generative Essay Detection in Education, GEDE),该数据集包含超过900篇学生撰写的作文以及超过12,500篇来自多个领域的LLM生成作文。为捕捉LLM在生成文本中实际使用方式的多样性,我们提出了贡献水平概念,表示学生对给定作业的贡献程度。这些水平范围从纯人类撰写的文本,到略微改进的LLM版本,到完全由LLM生成的文本,最后到对检测器进行的主动攻击,通过“人类化”生成文本。我们表明,大多数检测器在分类中间级学生贡献水平的文本时(如LLM改进的人类撰写文本)难以准确分类。检测器特别容易产生误报,这在教育环境中具有严重问题,因为误疑会严重影响学生的生活。我们的数据集、代码和其他补充材料已公开发布于https://github.com/lukasgehring/Assessing-LLM-Text-Detection-in-Educational-Contexts。
引用
@article{arxiv.2508.08096,
title = {Assessing LLM Text Detection in Educational Contexts: Does Human Contribution Affect Detection?},
author = {Lukas Gehring and Benjamin Paaßen},
journal= {arXiv preprint arXiv:2508.08096},
year = {2025}
}
备注
Preprint as provided by the authors (19 pages, 12 figures, 9 tables)