中文

GPT-Sentinel:区分人类与 ChatGPT 生成内容

计算与语言 2023-05-19 v2

摘要

本文提出了一种利用语言模型检测 ChatGPT 生成文本与人工撰写文本的新方法。为此,我们首先收集并发布了一个名为 OpenGPTText 的预处理数据集,其由使用 ChatGPT 生成的改写内容组成。随后,我们设计、实现并训练了两个不同的文本分类模型,分别采用鲁棒优化 BERT 预训练方法(RoBERTa)与文本到文本迁移 Transformer(T5)。我们的模型取得了显著结果,在测试集上通过多项指标评估的准确率超过 97%。此外,我们进行了可解释性研究,以展示我们的模型提取并区分人工撰写与 ChatGPT 生成文本之间关键特征的能力。我们的发现为有效利用语言模型检测生成文本提供了重要见解。

关键词

引用

@article{arxiv.2305.07969,
  title  = {GPT-Sentinel: Distinguishing Human and ChatGPT Generated Content},
  author = {Yutian Chen and Hao Kang and Vivian Zhai and Liangze Li and Rita Singh and Bhiksha Raj},
  journal= {arXiv preprint arXiv:2305.07969},
  year   = {2023}
}