PADBen:评估AI文本检测器抗 paraphrase 攻击的全面基准
计算与语言
2025-11-04 v1 人工智能
摘要
虽然AI生成文本(AIGT)检测器在直接LLM输出上实现了超过90%的准确率,但在面对迭代改写内容时会 catastrophic 失败。我们研究了为何迭代改写的文本——本身即为AI生成——能规避为AIGT识别而设计的检测系统。通过内在机制分析,我们揭示了迭代改写创建了一种由语义位移且保留生成模式的中间洗白区域,这带来了两个攻击类别:改写人类撰写的文本(内容混淆)和改写LLM生成的文本(抄袭规避)。为解决这些漏洞,我们引入PADBen——第一个系统评估检测器对抗两种 paraphrase 攻击情景的基准。PADBen包含捕捉从原始内容到深度洗白文本全轨迹的五类文本分类,以及句子对和单句挑战下的五个渐进检测任务。我们评估了11个最先进的检测器,发现关键不对称:检测器成功识别抄袭规避问题,但在内容混淆情形下失败。我们的发现表明,当前检测方法无法有效处理中间洗白区域, necessitating 在现有语义和风格判别方法之外的检测体系结构进行根本性进展。有关详细代码实现,请参见 https://github.com/JonathanZha47/PadBen-Paraphrase-Attack-Benchmark。
引用
@article{arxiv.2511.00416,
title = {PADBen: A Comprehensive Benchmark for Evaluating AI Text Detectors Against Paraphrase Attacks},
author = {Yiwei Zha and Rui Min and Shanu Sushmita},
journal= {arXiv preprint arXiv:2511.00416},
year = {2025}
}