中文

人类化机器:用于误导 LLM 检测器的代理攻击

机器学习 2025-02-25 v2 计算与语言 密码学与安全

摘要

大型语言模型(LLM)的出现在文本生成领域取得了显著进展,产生的输出与人类编写的文本几乎难以区分。尽管学术界和工业界已开发出检测器以防止 LLM 生成文本的恶意用途,但其他研究对这些系统的鲁棒性表示怀疑。为检验这些检测器的鲁棒性,我们引入一种代理攻击策略,轻松地使 LLM 产生与人类编写文本相匹配的输出,从而误导检测系统。我们的攻击方法通过利用在解码阶段利用强化学习微调的人类化小型语言模型(SLM)来攻击源模型。通过深入分析,我们证明了该攻击策略能够生成难以被检测器区分的响应,使其无法区分机器生成和人类编写的文本。我们在大量数据集上进行了系统评估,使用包括 Llama2-13B、Llama3-70B 和 Mixtral-8*7B 在内的开源模型进行白盒和黑盒测试。我们的发现表明,代理攻击策略有效地欺骗了领先的检测器,在多个数据集上平均降低 70.4% 的 AUROC,单个数据集的最大降幅达 90.3%。此外,在跨学科场景中,我们的策略还能绕过这些检测器,导致最多 90.9% 的显著相对下降;在跨语言场景中,下降幅度达 91.3%。尽管我们的代理攻击策略通过如此显著的相对下降成功地绕过了检测器,但我们发现与原始未受攻击的源模型相比,受攻击模型的生成质量仍保持完整,即使在有限的效用预算下也然亦。

关键词

引用

@article{arxiv.2410.19230,
  title  = {Humanizing the Machine: Proxy Attacks to Mislead LLM Detectors},
  author = {Tianchun Wang and Yuanzhou Chen and Zichuan Liu and Zhanwen Chen and Haifeng Chen and Xiang Zhang and Wei Cheng},
  journal= {arXiv preprint arXiv:2410.19230},
  year   = {2025}
}

备注

29 pages