中文

理解开放域聊天机器人中的多轮有毒行为

密码学与安全 2023-07-20 v1 人工智能 计算与语言

摘要

自然语言处理与机器学习的最新进展催生了能够与用户进行对话交互的聊天机器人模型,如 ChatGPT。然而,这些模型在非有毒多轮对话中生成有毒或有害回复的能力仍是一个开放的研究问题。现有研究聚焦于单轮句子测试,而我们发现,在对话中引发有毒行为的个体非有毒句子有82%被现有工具判定为安全。本文中,我们设计了一种新的攻击方法 \toxicbot,通过微调一个聊天机器人与目标开放域聊天机器人进行对话。该聊天机器人使用一组精心构建的对话序列进行微调。特别地,每轮对话以精心构建的提示句数据集中的一句开头。我们广泛的评估表明,开放域聊天机器人模型可在多轮对话中被触发生成有毒回复。在最佳情形下,\toxicbot 达到了67%的激活率。微调阶段的对话序列有助于触发对话中的毒性,使该攻击能够绕过两种防御方法。我们的发现表明,需要在动态交互环境中进一步研究聊天机器人毒性问题。所提出的 \toxicbot 可被业界与研究人员用于开发检测和缓解对话中有毒回复的方法,并提升终端用户所用聊天机器人的鲁棒性。

关键词

引用

@article{arxiv.2307.09579,
  title  = {Understanding Multi-Turn Toxic Behaviors in Open-Domain Chatbots},
  author = {Bocheng Chen and Guangjing Wang and Hanqing Guo and Yuanda Wang and Qiben Yan},
  journal= {arXiv preprint arXiv:2307.09579},
  year   = {2023}
}

备注

RAID 2023