中文

GradEscape:一种基于梯度的 AI 生成文本检测器逃逸方法

密码学与安全 2025-10-31 v2 计算与语言

摘要

在本文中,我们介绍了 GradEscape,这是第一种旨在攻击 AI 生成文本(AIGT)检测器的基于梯度的逃逸方法。GradEscape 通过引入一种为检测器输入构建加权嵌入的新方法,克服了由文本离散性质引起的不可微计算问题。随后,它利用来自受害检测器的反馈更新逃逸模型参数,以极小的文本修改实现了高攻击成功率。为了解决逃逸器与检测器之间分词器不匹配的问题,我们引入了一种热启动逃逸器方法,使 GradEscape 能够适应任何语言模型架构的检测器。此外,我们采用了新颖的分词器推理和模型提取技术,即使在仅查询访问的情况下也能实现有效逃逸。我们在四个数据集和三种广泛使用的语言模型上评估了 GradEscape,并将其与四种最先进的 AIGT 逃逸器进行了基准测试。实验结果表明,GradEscape 在各种场景中均优于现有逃逸器,包括与 11B 参数的复述模型相比,而仅利用 139M 参数。我们已成功将 GradEscape 应用于两个真实的商业 AIGT 检测器。我们的分析表明,主要脆弱性源于训练数据中文本表达风格的差异。我们还提出了一种潜在的防御策略,以减轻 AIGT 逃逸器的威胁。我们开源了 GradEscape,以开发更鲁棒的 AIGT 检测器。

关键词

引用

@article{arxiv.2506.08188,
  title  = {GradEscape: A Gradient-Based Evader Against AI-Generated Text Detectors},
  author = {Wenlong Meng and Shuguo Fan and Chengkun Wei and Min Chen and Yuwei Li and Yuanchao Zhang and Zhikun Zhang and Wenzhi Chen},
  journal= {arXiv preprint arXiv:2506.08188},
  year   = {2025}
}

备注

Accepted by USENIX Security'25; Update badges and Artifact Appendix