中文

对对抗后缀学习进行更深入的探讨:增强型对抗触发学习

机器学习 2025-11-21 v4 人工智能

摘要

梯度优化基于的对抗攻击方法自动学习对抗触发器以生成越狱提示或泄露系统提示。在本工作中,我们更深入地审视了对抗触发学习的优化目标,提出了 ATLA:使用增强目标的对抗触发学习。ATLA 将之前研究人们使用的负对数似然损失改为加权损失形式,以鼓励所学习的对抗触发器更加优化响应格式 token。这使 ATLA 能够仅通过一个查询-响应对学习对抗触发器,并且所学触发器对其他类似查询具有良好的泛化。我们进一步设计了一种变体,将辅助损失用于抑制回避响应,以增强触发器优化。我们展示了如何使用 ATLA 来学习越狱后缀以越狱 LLMs 并提取隐藏系统提示。经验上,我们证明 ATLA 持续地优于当前最新技术,攻击成功率几乎为 100%,且所需查询次数减少 80%。ATLA 学习的越狱后缀对未见查询具有高度泛化,并能良好迁移到新的 LLMs。我们发布了代码 https://github.com/QData/ALTA_Augmented_Adversarial_Trigger_Learning

关键词

引用

@article{arxiv.2503.12339,
  title  = {A Closer Look at Adversarial Suffix Learning for Jailbreaking LLMs: Augmented Adversarial Trigger Learning},
  author = {Zhe Wang and Yanjun Qi},
  journal= {arXiv preprint arXiv:2503.12339},
  year   = {2025}
}

备注

the Association for Computational Linguistics: NAACL 2025