中文

通过物理论文评估学术写作中AI与人类作者的质量

物理教育 2024-03-11 v1

摘要

本研究评估了n=300n = 300篇短篇物理论文,这些论文平均分为在ChatGPT引入前提交的学生作业和由OpenAI的GPT-4生成的论文。在由五位不了解论文来源的独立评分员进行的盲评中,我们观察到人类作者和AI生成的论文在分数上没有统计学上的显著差异(p值=0.107= 0.107α=0.05\alpha = 0.05)。此外,当评分员随后尝试在4点李克特量表(从“肯定是AI”到“肯定是人类”)上识别论文的作者身份时,他们的表现仅略优于随机猜测。这一结果不仅凸显了AI与人类作者质量的趋同,也强调了仅通过人类判断来辨别AI生成内容的难度。此外,还评估了五种商用软件工具识别论文作者身份的有效性。其中,ZeroGPT最为准确,在其分类简化为二元结果时,达到了98%的准确率和1.0的精确率。这一结果为维持评估诚信带来了潜在的乐观前景。最后,我们提出,AI生成内容占比50%\leq 50\%的文本应被视为人类作者的上限,这一界限既包容了未来无处不在的AI辅助,也尊重了人类作者身份。

关键词

引用

@article{arxiv.2403.05458,
  title  = {Evaluating AI and Human Authorship Quality in Academic Writing through Physics Essays},
  author = {Will Yeadon and Elise Agra and Oto-obong Inyang and Paul Mackay and Arin Mizouri},
  journal= {arXiv preprint arXiv:2403.05458},
  year   = {2024}
}

备注

18 pages, 5 figures