中文

基于黑箱大语言模型自适应优化机制的后门攻击

计算机视觉与模式识别 2025-04-21 v1 图像与视频处理

摘要

以插入式和改写式后门先前取得了卓越的攻击效果,但忽略了受污染文本与干净文本之间的文本质量和语义一致性。虽然最近的研究引入 LLM 生成受污染文本以提高隐蔽性、语义一致性和文本质量,但其手工编写的提示依赖专家经验,面临提示适应性和遮蔽后的攻击性能挑战。本文提出一种基于黑箱大语言模型自适应优化机制的新型后门攻击 (BadApex),该方法利用黑箱 LLM 通过精细化的提示生成受污染文本。具体而言,设计了自适应优化机制,以迭代方式 refined 一个初始提示。生成代理基于初始提示生成受污染文本。然后,修改代理评估受污染文本的质量并 refined 一个新的提示。在上述过程的多次迭代后,使用精细化的提示生成受污染文本。我们在三个数据集上进行了大量实验,涉及六种后门攻击和两种防御方法。广泛的实验结果表明,BadApex 在攻击效果上显著优于最先进的攻击方法。它提高了提示适应性、语义一致性和文本质量。此外,在应用两种防御方法后,平均攻击成功率 (ASR) 仍可达到 96.75%。

关键词

引用

@article{arxiv.2504.13776,
  title  = {Fighting Fires from Space: Leveraging Vision Transformers for Enhanced Wildfire Detection and Characterization},
  author = {Aman Agarwal and James Gearon and Raksha Rank and Etienne Chenevert},
  journal= {arXiv preprint arXiv:2504.13776},
  year   = {2025}
}