中文

来自有毒人类反馈的通用越狱后门

人工智能 2024-04-30 v4 计算与语言 密码学与安全 机器学习

摘要

基于人类反馈的强化学习(RLHF)被用于对齐大语言模型以产生有用且无害的回复。然而,先前工作表明,这些模型可通过寻找对抗性提示使其恢复未对齐行为而被越狱。本文考虑一种新的威胁:攻击者毒化 RLHF 训练数据,在模型中嵌入“越狱后门”。该后门将触发词嵌入模型,其作用类似于通用的“sudo 命令”:向任意提示添加该触发词即可产生有害回复,而无需搜索对抗性提示。通用越狱后门比先前研究的语言模型后门强大得多,且我们发现使用常见后门攻击技术显著更难植入。我们探究 RLHF 中导致其所谓鲁棒性的设计决策,并发布一组毒化模型基准以激发未来关于通用越狱后门的研究。

关键词

引用

@article{arxiv.2311.14455,
  title  = {Universal Jailbreak Backdoors from Poisoned Human Feedback},
  author = {Javier Rando and Florian Tramèr},
  journal= {arXiv preprint arXiv:2311.14455},
  year   = {2024}
}

备注

Accepted as conference paper in ICLR 2024