自伪装攻击:诱使LLM为规避AIGT检测而自我伪装
密码学与安全
2025-08-25 v1 计算与语言
摘要
AI生成文本(AIGT)检测规避旨在降低AIGT被检测的概率,有助于识别检测器的弱点并提升其在实际应用中的有效性和可靠性。尽管现有规避方法表现良好,但存在高计算成本和文本质量下降的问题。为此,我们提出自伪装攻击(Self-Disguise Attack, SDA),一种新方法,使大语言模型(LLM)能够主动伪装其输出,降低分类器检测的可能性。SDA包含两个主要组件:对抗特征提取器和基于检索的上下文示例优化器。前者生成伪装特征,使LLM理解如何生成更类似人类的文本;后者从外部知识库检索最相关的示例作为上下文示例,进一步提升LLM的自我伪装能力,减轻伪装过程对文本多样性的影响。SDA直接运用包含伪装特征和优化后上下文示例的提示词,引导LLM生成抗检测文本,从而降低资源消耗。实验结果表明,SDA在三种不同LLM生成的文本上有效降低了各种AIGT检测器的平均检测准确率,同时保持了AIGT的质量。
引用
@article{arxiv.2508.15848,
title = {Self-Disguise Attack: Induce the LLM to disguise itself for AIGT detection evasion},
author = {Yinghan Zhou and Juan Wen and Wanli Peng and Zhengxian Wu and Ziwei Zhang and Yiming Xue},
journal= {arXiv preprint arXiv:2508.15848},
year = {2025}
}