愚弄监视者:通过语义提示攻击破解 AIGC 检测器
计算机视觉与模式识别
2025-05-30 v1 人工智能
密码学与安全
摘要
文本到图像(T2I)模型的兴起使得合成逼真的人像成为可能,引发了对身份滥用和 AIGC 检测器鲁棒性的严重担忧。在本工作中,我们提出了一个自动化对抗提示生成框架,该框架利用语法树结构和蒙特卡洛树搜索算法的变体,系统地探索语义提示空间。我们的方法生成多样且可控的提示,能够持续规避开源和商业 AIGC 检测器。在多个 T2I 模型上的大量实验验证了其有效性,该方法在现实世界的对抗性 AIGC 检测竞赛中排名第一。除了攻击场景,我们的方法还可用于构建高质量的对抗数据集,为训练和评估更鲁棒的 AIGC 检测与防御系统提供宝贵资源。
引用
@article{arxiv.2505.23192,
title = {Fooling the Watchers: Breaking AIGC Detectors via Semantic Prompt Attacks},
author = {Run Hao and Peng Ying},
journal= {arXiv preprint arXiv:2505.23192},
year = {2025}
}
备注
9 pages