中文

ChatGPT 作为攻击工具:通过黑盒生成模型触发器的隐秘文本后门攻击

密码学与安全 2023-05-01 v1 机器学习

摘要

文本后门攻击对现有系统构成实际威胁,因为它们可通过在输入中插入难以察觉的触发器并操纵训练数据集中的标签来攻陷模型。随着 GPT-4 等前沿生成模型将改写能力提升至极高水准,此类攻击变得愈发难以检测。我们对黑盒生成模型作为后门攻击工具的作用进行了全面调研,强调了研究相关防御策略的重要性。本文中,我们揭示了所提出的基于生成模型的攻击 BGMAttack 能够有效欺骗文本分类器。相比传统攻击方法,BGMAttack 借助最先进的生成模型使后门触发器更不显眼。我们在五个数据集上对所提攻击有效性进行了广泛评估,并辅以三种不同的人认知评估,结果表明 Figure 4 在保持优于基线方法的隐蔽性的同时,取得了可比的攻击性能。

关键词

引用

@article{arxiv.2304.14475,
  title  = {ChatGPT as an Attack Tool: Stealthy Textual Backdoor Attack via Blackbox Generative Model Trigger},
  author = {Jiazhao Li and Yijin Yang and Zhuofeng Wu and V. G. Vinod Vydiswaran and Chaowei Xiao},
  journal= {arXiv preprint arXiv:2304.14475},
  year   = {2023}
}