中文

通过单个空格规避 ChatGPT 检测器

计算与语言 2023-10-16 v2 人工智能

摘要

ChatGPT 带来了革命性的社会价值,但也引发了关于 AI 生成文本被滥用的担忧。因此,一个重要问题是如何检测文本是由 ChatGPT 还是由人类生成的。现有检测器建立在人类生成文本与 AI 生成文本之间存在分布差距的假设之上。这些差距通常通过统计信息或分类器来识别。我们的研究挑战了检测器中的分布差距假设。我们发现,检测器并不能有效区分人类生成与 AI 生成文本之间的语义和风格差距。相反,“细微差异”,例如一个额外的空格,成为检测的关键。基于这一发现,我们提出了 SpaceInfi 策略以规避检测。实验证明了该策略在多个基准和检测器上的有效性。我们还从理论上解释了 SpaceInfi 为何能成功规避基于困惑度的检测,并实证表明一种称为 token mutation(词元突变)的现象导致了基于语言模型的检测器的规避。我们的发现为理解和构建更具适用性的 ChatGPT 检测器提供了新的见解与挑战。

关键词

引用

@article{arxiv.2307.02599,
  title  = {Evade ChatGPT Detectors via A Single Space},
  author = {Shuyang Cai and Wanyun Cui},
  journal= {arXiv preprint arXiv:2307.02599},
  year   = {2023}
}