中文

BadGPT:通过对InstructGPT的后门攻击探索ChatGPT的安全漏洞

密码学与安全 2023-04-25 v1 人工智能

摘要

近来,ChatGPT因其有效与人交互的能力而在研究中获得显著关注。该模型背后的核心思想是强化学习(RL)微调,这是一种允许语言模型与人类偏好对齐的新范式,即InstructGPT。在本研究中,我们提出BadGPT,首个针对语言模型中RL微调的后门攻击。通过向奖励模型中注入后门,语言模型可在微调阶段被攻陷。我们在电影评论(即IMDB)上的初步实验表明,攻击者可通过BadGPT操纵生成的文本。

关键词

引用

@article{arxiv.2304.12298,
  title  = {BadGPT: Exploring Security Vulnerabilities of ChatGPT via Backdoor Attacks to InstructGPT},
  author = {Jiawen Shi and Yixin Liu and Pan Zhou and Lichao Sun},
  journal= {arXiv preprint arXiv:2304.12298},
  year   = {2023}
}

备注

This paper is accepted as a poster in NDSS2023