StealthRL:面向多检测器规避的强化学习改写攻击
机器学习
2026-03-23 v2 人工智能
密码学与安全
摘要
AI 文本检测器面临一个关键鲁棒性挑战:保持语义的对抗性改写攻击以规避检测。我们引入 StealthRL,一个强化学习框架,用于在真实对抗条件下测试检测器的鲁棒性。StealthRL 使用 Group Relative Policy Optimization (GRPO) 对多检测器集成训练的改写策略,采用 Qwen3-4B 上的 LoRA adapters,优化复合奖励以平衡检测规避与语义保持。我们在六个攻击设置 (M0-M5) 上评估了完整过滤的 MAGE 测试池(15,310 人类 / 14,656 AI),针对四个检测器:RoBERTa、Fast-DetectGPT、Binoculars 和 MAGE。StealthRL 在三个检测器上实现近零检测,在第四个检测器上实现 0.024 的 mean TPR@1%FPR,将 mean AUROC 从 0.79 降至 0.43,达到 97.6% 的攻击成功率。关键的是,攻击可转移到两个在训练期间未看到的 held-out 检测器,揭示了共享架构漏洞而非检测器特定脆弱性。我们另外通过在 500 个匹配样本上进行 LLM 基于 Likert 评分的质量评估,分析检测器得分分布以解释为何成功规避,并提供带 bootstrap confidence intervals 的每个检测器的 AUROC。我们的结果暴露了当前 AI 文本检测的显著鲁棒性差距,并将 StealthRL 确立为原则性对抗评估协议。代码和评估管道已公开于 https://github.com/suraj-ranganath/StealthRL。
引用
@article{arxiv.2602.08934,
title = {StealthRL: Reinforcement Learning Paraphrase Attacks for Multi-Detector Evasion of AI-Text Detectors},
author = {Suraj Ranganath and Atharv Ramesh},
journal= {arXiv preprint arXiv:2602.08934},
year = {2026}
}
备注
Expanded version of a workshop submission. Code available