DNA-GPT:用于免训练检测 GPT 生成文本的发散 N 元文法分析
计算与语言
2023-10-05 v2 人工智能
摘要
大语言模型(LLMs)显著增强了机器生成文本的流畅性与多样性。然而,这一进展也给检测给定文本的来源带来了重大挑战,且当前检测方法的研究滞后于 LLM 的快速演进。传统的基于训练的方法在灵活性(尤其适应新领域时)上存在局限,且往往缺乏解释力。为弥补这一不足,我们提出一种名为发散 N 元文法分析(DNA-GPT)的新型免训练检测策略。对于给定的文本,我们首先在中间截断,然后仅将前文部分作为输入提供给 LLM 以重新生成新的剩余部分。通过黑盒下的 N 元文法分析或白盒下的概率散度分析原始与新生剩余部分之间的差异,我们揭示了机器生成文本分布与人类书写文本分布之间的显著分歧。我们在 OpenAI 最先进的 LLM(包括 text-davinci-003、GPT-3.5-turbo 和 GPT-4)以及开源模型(如 GPT-NeoX-20B 和 LLaMa-13B)上进行了大量实验。结果表明,我们的零样本方法在四个英文和一个德文数据集上区分人类与 GPT 生成文本方面表现出最先进的性能,优于在数百万文本上训练而成的 OpenAI 自有分类器。此外,我们的方法提供了合理的解释与证据以支持我们的主张,这是可解释检测的独特之处。我们的方法在改写文本攻击下也具有鲁棒性,并可额外解决模型溯源问题。代码见 https://github.com/Xianjun-Yang/DNA-GPT。
引用
@article{arxiv.2305.17359,
title = {DNA-GPT: Divergent N-Gram Analysis for Training-Free Detection of GPT-Generated Text},
author = {Xianjun Yang and Wei Cheng and Yue Wu and Linda Petzold and William Yang Wang and Haifeng Chen},
journal= {arXiv preprint arXiv:2305.17359},
year = {2023}
}
备注
Updates