来自有毒人类反馈的通用越狱后门
人工智能
2024-04-30 v4 计算与语言
密码学与安全
机器学习
摘要
基于人类反馈的强化学习(RLHF)被用于对齐大语言模型以产生有用且无害的回复。然而,先前工作表明,这些模型可通过寻找对抗性提示使其恢复未对齐行为而被越狱。本文考虑一种新的威胁:攻击者毒化 RLHF 训练数据,在模型中嵌入“越狱后门”。该后门将触发词嵌入模型,其作用类似于通用的“sudo 命令”:向任意提示添加该触发词即可产生有害回复,而无需搜索对抗性提示。通用越狱后门比先前研究的语言模型后门强大得多,且我们发现使用常见后门攻击技术显著更难植入。我们探究 RLHF 中导致其所谓鲁棒性的设计决策,并发布一组毒化模型基准以激发未来关于通用越狱后门的研究。
引用
@article{arxiv.2311.14455,
title = {Universal Jailbreak Backdoors from Poisoned Human Feedback},
author = {Javier Rando and Florian Tramèr},
journal= {arXiv preprint arXiv:2311.14455},
year = {2024}
}
备注
Accepted as conference paper in ICLR 2024