中文

ArguGPT:评估、理解并识别由GPT模型生成的议论文

计算与语言 2023-09-26 v2

摘要

AI生成内容(AIGC)给全球教育工作者带来了相当大的挑战。教师需要能够检测由大语言模型生成的此类文本,无论是用肉眼还是借助某些工具。理解AIGC的词汇、句法和风格特征的需求也在不断增长。为了应对英语教学中的这些挑战,我们首先提出ArguGPT,一个包含4,038篇由7个GPT模型针对来自三个来源的作文提示生成的议论文的平衡语料库:(1)课堂或家庭作业练习,(2)TOEFL和(3)GRE写作任务。机器生成的文本与数量大致相等的人类撰写文章配对,并在作文提示上匹配三个分数等级。随后我们聘请英语教师来区分机器文章与人类文章。结果表明,当首次接触机器生成的文章时,教师检测它们的准确率仅为61%。但在一轮最小的自我训练后,该数字上升到67%。接下来,我们对这些文章进行语言分析,显示机器产生的句子具有更复杂的句法结构,而人类文章往往在词汇上更复杂。最后,我们测试现有的AIGC检测器,并使用SVM和RoBERTa构建我们自己的检测器。结果表明,用ArguGPT训练集微调的RoBERTa在文章级和句子级分类中均达到90%以上的准确率。据我们所知,这是对生成式大语言模型产生的议论文的首次综合分析。ArguGPT中的机器创作文章及我们的模型将在https://github.com/huhailinguist/ArguGPT公开提供。

关键词

引用

@article{arxiv.2304.07666,
  title  = {ArguGPT: evaluating, understanding and identifying argumentative essays generated by GPT models},
  author = {Yikang Liu and Ziyin Zhang and Wanyang Zhang and Shisen Yue and Xiaojing Zhao and Xinyuan Cheng and Yiwen Zhang and Hai Hu},
  journal= {arXiv preprint arXiv:2304.07666},
  year   = {2023}
}