中文

投毒是否是 LLM 对齐的真实威胁?或许比你想象的更为严重

机器学习 2025-06-10 v4 计算与语言 密码学与安全

摘要

近期强化学习与人类反馈(RLHF)的进展显著影响了大型语言模型(LLM)的对齐。由于强化学习算法(如近端策略优化,PPO)的敏感性,导致了关于直接策略优化(DPO)的新研究,这将 RLHF 视为监督学习框架。这些 RLHF 方法的日益普及 warrants 对其脆弱性进行分析。在本工作中,我们研究了 DPO 面临的脆弱性,分析了不同情景下的脆弱性,并比较了偏好投毒(这是首次将其提出)的有效性。我们全面分析了 DPO 在不同类型攻击下(即后门攻击和非后门攻击)以及不同投毒方法下的脆弱性,涵盖广泛的语言模型,即 LLaMa 7B、Mistral 7B 和 Gemma 7B。我们发现,与基于 PPO 的方法不同,后门攻击需要至少4%的数据被投毒才能引发有害行为,而我们利用 DPO 的真实脆弱性,只需投毒约0.5%的数据即可实现。我们进一步探讨了这种脆弱性的潜在原因,以及这种脆弱性如何在后门与非后门攻击中转化。

关键词

引用

@article{arxiv.2406.12091,
  title  = {Is poisoning a real threat to LLM alignment? Maybe more so than you think},
  author = {Pankayaraj Pathmanathan and Souradip Chakraborty and Xiangyu Liu and Yongyuan Liang and Furong Huang},
  journal= {arXiv preprint arXiv:2406.12091},
  year   = {2025}
}