中文

通过微调移除 GPT-4 中的 RLHF 保护机制

计算与语言 2024-04-09 v3 人工智能

摘要

随着大语言模型(LLMs)能力的提升,其被双重利用的潜力也随之增加。为减少有害输出,LLM 的制造者与供应商已采用基于人类反馈的强化学习(RLHF)。与此同时,LLM 供应商正越来越多地允许对其最强大的模型进行微调。然而,同期工作表明微调可移除 RLHF 保护。我们可能预期当前最强大的可用模型(GPT-4)较不易受微调攻击。本工作中,我们展示了相反结果:微调使攻击者仅需少至 340 个样本即可以 95% 成功率移除 RLHF 保护。这些训练样本可由较弱模型自动生成。我们进一步表明,移除 RLHF 保护并不会降低在非审查输出上的有用性,证明尽管使用较弱模型生成训练数据,我们的微调策略并未削弱有用性。我们的结果显示了针对 LLM 保护机制进一步研究的必要性。

关键词

引用

@article{arxiv.2311.05553,
  title  = {Removing RLHF Protections in GPT-4 via Fine-Tuning},
  author = {Qiusi Zhan and Richard Fang and Rohan Bindu and Akul Gupta and Tatsunori Hashimoto and Daniel Kang},
  journal= {arXiv preprint arXiv:2311.05553},
  year   = {2024}
}

备注

Accepted to NAACL 2024. (7 pages)