GPT-Sentinel:区分人类与 ChatGPT 生成内容
计算与语言
2023-05-19 v2
摘要
本文提出了一种利用语言模型检测 ChatGPT 生成文本与人工撰写文本的新方法。为此,我们首先收集并发布了一个名为 OpenGPTText 的预处理数据集,其由使用 ChatGPT 生成的改写内容组成。随后,我们设计、实现并训练了两个不同的文本分类模型,分别采用鲁棒优化 BERT 预训练方法(RoBERTa)与文本到文本迁移 Transformer(T5)。我们的模型取得了显著结果,在测试集上通过多项指标评估的准确率超过 97%。此外,我们进行了可解释性研究,以展示我们的模型提取并区分人工撰写与 ChatGPT 生成文本之间关键特征的能力。我们的发现为有效利用语言模型检测生成文本提供了重要见解。
引用
@article{arxiv.2305.07969,
title = {GPT-Sentinel: Distinguishing Human and ChatGPT Generated Content},
author = {Yutian Chen and Hao Kang and Vivian Zhai and Liangze Li and Rita Singh and Bhiksha Raj},
journal= {arXiv preprint arXiv:2305.07969},
year = {2023}
}