中文

改写可规避 AI 生成文本检测器,但检索是有效的防御手段

计算与语言 2023-10-19 v2 密码学与安全 机器学习

摘要

大型语言模型的恶意使用(如虚假内容创作和学术剽窃)的增加,推动了识别 AI 生成文本方法的发展,包括基于水印或异常检测的方法。然而,这些检测算法对 AI 生成文本的改写的鲁棒性仍不清楚。为了对这些检测器进行压力测试,我们构建了一个 11B 参数的改写生成模型(DIPPER),该模型能够改写段落,以周围上下文为条件,并控制词汇多样性和内容重排。使用 DIPPER 对三个大型语言模型(包括 GPT3.5-davinci-003)生成的文本进行改写,成功规避了多个检测器,包括水印、GPTZero、DetectGPT 和 OpenAI 的文本分类器。例如,在 1% 的恒定误报率下,DIPPER 将 DetectGPT 的检测准确率从 70.3% 降至 4.6%,且未明显改变输入语义。为了提高 AI 生成文本检测对改写攻击的鲁棒性,我们引入了一种简单的防御方法,该方法依赖于检索语义相似的生成内容,且必须由语言模型 API 提供商维护。给定一段候选文本,我们的算法在 API 先前生成的序列数据库中进行搜索,寻找在特定阈值内与候选文本匹配的序列。我们使用来自微调 T5-XXL 模型的 1500 万条生成内容的数据库对我们的防御方法进行了实证验证,发现它可以在不同设置下检测出 80% 至 97% 的改写生成内容,同时仅将 1% 的人类撰写序列分类为 AI 生成。我们开源了我们的模型、代码和数据。

关键词

引用

@article{arxiv.2303.13408,
  title  = {Paraphrasing evades detectors of AI-generated text, but retrieval is an effective defense},
  author = {Kalpesh Krishna and Yixiao Song and Marzena Karpinska and John Wieting and Mohit Iyyer},
  journal= {arXiv preprint arXiv:2303.13408},
  year   = {2023}
}

备注

NeurIPS 2023 camera ready (32 pages). Code, models, data available in https://github.com/martiansideofthemoon/ai-detection-paraphrases