中文

ChatGPT 还是人类?检测与解释:解释用于检测短篇 ChatGPT 生成文本的机器学习模型决策

计算与语言 2023-02-01 v1 机器学习

摘要

ChatGPT 能够针对来自不同领域的各类问题生成语法完美且看似人类的回复。其用户数量与应用场景正以空前速度增长。不幸的是,使用与滥用总是相伴而生。本文研究机器学习模型能否被有效训练以准确区分原始人类文本与看似人类(即 ChatGPT 生成)的文本,尤其当文本较短时。此外,我们采用可解释人工智能框架,以深入理解训练用于区分 ChatGPT 生成与人类生成文本的模型背后的推理。目标是分析模型决策并确定是否能识别出特定模式或特征。我们的研究聚焦于短篇在线评论,进行了两个实验以比较人类生成与 ChatGPT 生成的文本。第一个实验涉及由自定义查询生成的 ChatGPT 文本,第二个实验涉及通过改写原始人类生成评论所得的文本。我们微调了一个基于 Transformer 的模型并用其进行预测,随后使用 SHAP 对预测进行解释。我们将自身模型与基于困惑度评分的方法比较,发现当使用改写文本时,机器学习模型区分人类与 ChatGPT 生成评论更为困难。然而,我们提出的方法仍达到了 79% 的准确率。通过可解释性,我们观察到 ChatGPT 的写作礼貌、缺乏具体细节、使用华丽且非典型词汇、非人称,且通常不表达情感。

关键词

引用

@article{arxiv.2301.13852,
  title  = {ChatGPT or Human? Detect and Explain. Explaining Decisions of Machine Learning Model for Detecting Short ChatGPT-generated Text},
  author = {Sandra Mitrović and Davide Andreoletti and Omran Ayoub},
  journal= {arXiv preprint arXiv:2301.13852},
  year   = {2023}
}

备注

11 pages, 8 figures, 2 tables