中文

基于日语计量文体学分析区分ChatGPT(-3.5、-4)生成与人工撰写的论文

计算与语言 2023-06-06 v3

摘要

2023年上半年,包括ChatGPT在内的文本生成式人工智能(AI)(由OpenAI推出,搭载GPT-3.5和GPT-4)在全球引起了广泛关注。在本研究中,我们首先比较了GPT(-3.5和-4)生成的文本与人工撰写文本的日语计量文体特征。我们进行了多维尺度分析(MDS),以确认三类共216篇文本(36位单一作者撰写的72篇学术论文、基于前述论文标题由GPT-3.5生成的72篇文本、以及由GPT-4生成的72篇文本)的分布,重点关注以下文体特征:(1)词性bigram,(2)助词bigram,(3)逗号位置,以及(4)功能词比率。MDS揭示了GPT(-3.5和-4)与人工文本在各文体特征上的明显分布差异。尽管GPT-4因参数更多而比GPT-3.5更强大,但GPT(-3.5和-4)的分布很可能重叠。这些结果表明,尽管未来参数数量可能增加,GPT生成文本在文体特征上可能仍无法接近人工撰写文本。其次,我们验证了随机森林(RF)针对两类(GPT与人工)基于日语文体特征的分类性能。本研究揭示了RF在各文体特征上的高性能:关注功能词比率的RF分类器达到了98.1%的准确率。此外,关注所有文体特征的RF分类器在所有性能指标(准确率、召回率、精确率和F1分数)上均达到100%。本研究得出结论:现阶段我们人类仅能在日语范围内区分ChatGPT与人工文本。

关键词

引用

@article{arxiv.2304.05534,
  title  = {Distinguishing ChatGPT(-3.5, -4)-generated and human-written papers through Japanese stylometric analysis},
  author = {Wataru Zaitsu and Mingzhe Jin},
  journal= {arXiv preprint arXiv:2304.05534},
  year   = {2023}
}

备注

17 pages, 5 figures, 5 tables