中文

RogueGPT:非伦理微调用158个词将ChatGPT4转变为流氓AI

计算机与社会 2024-07-24 v2 人工智能 计算与语言

摘要

生成式人工智能的伦理影响和滥用潜力是日益令人担忧的话题。本文探讨了ChatGPT的默认伦理护栏如何轻易地被简单的提示和微调所绕过,而广大公众可以毫不费力地访问这些功能。这种被恶意修改的ChatGPT版本,绰号“RogueGPT”,表现出了令人担忧的行为,超出了由越狱提示触发的行为。我们对RogueGPT的响应进行了实证研究,评估了其在回答本应禁止使用的问题时的灵活性。我们的发现引发了关于该模型对非法药物生产、酷刑方法和恐怖主义等主题知识的重大担忧。将ChatGPT引入歧途的便捷性,加上其全球可访问性,凸显了用于训练基础模型的数据质量以及伦理保障措施实施方面的严重问题。因此,我们强调了用户驱动修改的责任和危险,以及这些修改可能对AI程序员实施的安全保障和伦理模块设计产生的更广泛影响。

关键词

引用

@article{arxiv.2407.15009,
  title  = {RogueGPT: dis-ethical tuning transforms ChatGPT4 into a Rogue AI in 158 Words},
  author = {Alessio Buscemi and Daniele Proverbio},
  journal= {arXiv preprint arXiv:2407.15009},
  year   = {2024}
}