AI 生成的作文:特征及其对自动评分和学术诚信的影响
计算与语言
2025-10-17 v4 人工智能
摘要
大型语言模型(LLM)的快速发展使得生成连贯的作文成为可能,使得 AI 辅助写作在教育和专业领域变得日益常见。使用大规模实证数据,我们检验和基准测试了由流行 LLM 生成的作文的特征和质量,并讨论了其对写作评估的两个关键组成部分——自动评分和学术诚信——的影响。我们的发现突显了当应用于 AI 生成或受 AI 强烈影响的作文时,现有自动评分系统(如 e-rater)的局限性,并确定了包括开发捕获更深层思考特征和重新校准特征权重等方面的改进空间。尽管日益增长的担忧是各种 LLM 的不断增长可能削弱检测 AI 生成作文的可行性,但我们的结果表明,针对一个模型生成的作文训练的检测器通常能够以高准确率识别其他模型的文本,这表明在实践中保持有效的检测可能是可行的。
引用
@article{arxiv.2410.17439,
title = {AI-generated Essays: Characteristics and Implications on Automated Scoring and Academic Integrity},
author = {Yang Zhong and Jiangang Hao and Michael Fauss and Chen Li and Yuan Wang},
journal= {arXiv preprint arXiv:2410.17439},
year = {2025}
}
备注
29 pages