中文

针对 LLM 对齐的对抗性增强的特定于提示的模糊后门生成器 AdvBDGen

机器学习 2025-06-06 v3

摘要

随着基于人类反馈的强化学习 (RLHF) 在对大型语言模型 (LLM) 进行对齐方面的广泛采用,后门在对齐期间安装的风险日益增加,导致意外且有害的行为。现有后门触发器通常局限于固定单词模式,在数据清理期间容易被检测,并在投毒后容易被移除。本文探索了将特定于提示的改写用作后门触发器,以增强其隐蔽性和在 LLM 对齐期间的抗移除性。我们提出了 AdvBDGen,一个 adversarially fortified 的生成式微调框架,自动生成有效、隐蔽且跨模型可迁移的特定于提示的后门。AdvBDGen 使用生成器-判别器对,由对手加固,以确保后门的可安装性和隐蔽性。它能够使用仅 3% 的微调数据精心制作并成功安装复杂触发器。安装后,这些后门在推理期间可用于越狱 LLM, demonstrate 相对于传统恒定触发器更抗扰动稳定,且更难以移除。这些发现凸显了迫切需要研究社区开发更健壮的防御机制,以应对 LLM 对齐中对抗性后门威胁的需求。

关键词

引用

@article{arxiv.2410.11283,
  title  = {AdvBDGen: Adversarially Fortified Prompt-Specific Fuzzy Backdoor Generator Against LLM Alignment},
  author = {Pankayaraj Pathmanathan and Udari Madhushani Sehwag and Michael-Andrei Panaitescu-Liess and Furong Huang},
  journal= {arXiv preprint arXiv:2410.11283},
  year   = {2025}
}

备注

Published at the Neurips Safe Generative AI Workshop 2024