中文

对攻击进行建模:通过量化对抗扰动检测 AI 生成文本

密码学与安全 2025-10-06 v1 人工智能 计算与语言

摘要

高度先进的大型语言模型(LLM)的快速发展构成了巨大的双用途问题,使得构建可靠的 AI 生成文本检测系统成为必要。现代检测器极易受到对抗攻击的影响,其中改写作为一种有效的规避技术,能够破坏统计检测。本文对对抗鲁棒性进行了比较研究,首先量化了标准对抗训练的局限性,随后引入了一种新颖且具有显著更强弹性的检测框架:扰动不变特征工程(PIFE)。该框架通过多阶段归一化流水线首先将输入文本转换为标准化形式,然后使用 Levenshtein 距离和语义相似度等指标量化转换的幅度,并将这些信号直接馈送给分类器,从而增强检测能力。我们针对字符级、词级和句子级攻击的分层分类法,评估了常规加固的 Transformer 和我们增强 PIFE 的模型。我们的研究结果首先证实,常规对抗训练虽然对句法噪声具有弹性,但在面对语义攻击时却会失效,我们将这种效应称为“语义规避阈值”,此时在严格的 1% 误报率下,其真阳性率骤降至 48.8%。形成鲜明对比的是,我们的 PIFE 模型明确地从文本与其规范形式之间的差异中提取特征,克服了这一局限性。在相同条件下,它保持了出色的 82.6% TPR,有效中和了最复杂的语义攻击。这一卓越的性能表明,显式地对扰动伪影进行建模,而不仅仅是在其上进行训练,是在对抗军备竞赛中实现真正鲁棒性的一条更有前景的路径。

关键词

引用

@article{arxiv.2510.02319,
  title  = {Modeling the Attack: Detecting AI-Generated Text by Quantifying Adversarial Perturbations},
  author = {Lekkala Sai Teja and Annepaka Yadagiri and Sangam Sai Anish and Siva Gopala Krishna Nuthakki and Partha Pakray},
  journal= {arXiv preprint arXiv:2510.02319},
  year   = {2025}
}

备注

8 pages, 3 figures