中文

RLHFPoison:面向大语言模型人类反馈强化学习的奖励投毒攻击

人工智能 2024-06-21 v2 计算与语言 密码学与安全 人机交互

摘要

人类反馈强化学习(RLHF)是一种旨在将大语言模型(LLMs)与人类偏好对齐的方法,在 LLMs 对齐中发挥重要作用。尽管有其优势,RLHF 依赖人类标注者对文本进行排序,若有对抗性标注者(即攻击者)通过提升任何恶意文本的排名来操纵评分以对抗性地引导 LLM,则可能引入潜在安全漏洞。为评估 RLHF 针对人类偏好数据投毒的红队测试,我们提出 RankPoison,一种通过对偏好排序翻转的候选选择进行投毒攻击的方法,以达成特定恶意行为(例如生成更长序列,从而增加计算成本)。利用 RankPoison 生成的投毒数据集,我们可对 LLMs 实施投毒攻击,使其生成更长 token 而不损害原始安全对齐性能。此外,应用 RankPoison,我们还成功实现了后门攻击,使 LLMs 在含触发词的问题下生成更长回答。我们的发现凸显了 RLHF 中的关键安全挑战,强调了对 LLMs 更鲁棒对齐方法的必要性。

关键词

引用

@article{arxiv.2311.09641,
  title  = {RLHFPoison: Reward Poisoning Attack for Reinforcement Learning with Human Feedback in Large Language Models},
  author = {Jiongxiao Wang and Junlin Wu and Muhao Chen and Yevgeniy Vorobeychik and Chaowei Xiao},
  journal= {arXiv preprint arXiv:2311.09641},
  year   = {2024}
}