中文

PPO 调整后的语言模型是否容易被攻击?

计算与语言 2024-06-06 v1 密码学与安全 机器学习

摘要

已提出诸多算法来对齐语言模型,以消除不良行为。然而,由于状态空间极大且创建合适的奖励函数常常导致各种越狱现象。我们的论文旨在检视奖励在积极情感语言生成的受控环境中的作用。我们不采用基于人类反馈的在线奖励模型训练,而是采用静态学习的情感分类器。我们还考虑模型的权重和激活在训练后暴露给最终用户的情形。在对预训练的 GPT-2 进行 mechanistic 解释性分析后应用近端策略优化 (PPO) 以促进积极情感响应之前,我们检视了该模型。基于这些见解,我们 (1) 尝试“攻击”经过 PPO 调整的模型以生成消极情感响应,(2) 添加一条奖励函数术语以尝试改变“消极”权重。

关键词

引用

@article{arxiv.2406.02577,
  title  = {Are PPO-ed Language Models Hackable?},
  author = {Suraj Anand and David Getzen},
  journal= {arXiv preprint arXiv:2406.02577},
  year   = {2024}
}

备注

8 pages, 4 figures