通过物理论文评估学术写作中AI与人类作者的质量
物理教育
2024-03-11 v1
摘要
本研究评估了篇短篇物理论文,这些论文平均分为在ChatGPT引入前提交的学生作业和由OpenAI的GPT-4生成的论文。在由五位不了解论文来源的独立评分员进行的盲评中,我们观察到人类作者和AI生成的论文在分数上没有统计学上的显著差异(p值,)。此外,当评分员随后尝试在4点李克特量表(从“肯定是AI”到“肯定是人类”)上识别论文的作者身份时,他们的表现仅略优于随机猜测。这一结果不仅凸显了AI与人类作者质量的趋同,也强调了仅通过人类判断来辨别AI生成内容的难度。此外,还评估了五种商用软件工具识别论文作者身份的有效性。其中,ZeroGPT最为准确,在其分类简化为二元结果时,达到了98%的准确率和1.0的精确率。这一结果为维持评估诚信带来了潜在的乐观前景。最后,我们提出,AI生成内容占比的文本应被视为人类作者的上限,这一界限既包容了未来无处不在的AI辅助,也尊重了人类作者身份。
引用
@article{arxiv.2403.05458,
title = {Evaluating AI and Human Authorship Quality in Academic Writing through Physics Essays},
author = {Will Yeadon and Elise Agra and Oto-obong Inyang and Paul Mackay and Arin Mizouri},
journal= {arXiv preprint arXiv:2403.05458},
year = {2024}
}
备注
18 pages, 5 figures