为何如此有毒?开放域聊天机器人中毒性行为的大规模度量与触发
计算机与社会
2022-09-12 v2 人工智能
密码学与安全
社会与信息网络
摘要
聊天机器人被用于许多应用中,例如自动代理、智能家居助手、在线游戏中的交互角色等。因此,确保其不以不良方式行为、向用户提供攻击性或有毒的回复至关重要。这不是一项简单的任务,因为最先进的聊天机器人模型是在从互联网公开收集的大型公共数据集上训练的。本文提出了首个针对聊天机器人中毒性(toxicity)的大规模度量研究。我们表明,公开可用的聊天机器人在输入有毒查询时容易提供有毒回复。更令人担忧的是,一些无毒查询也会触发有毒回复。随后,我们着手设计并实验了一种名为 ToxicBuddy 的攻击方法,该方法依赖于微调 GPT-2 来生成使聊天机器人以有毒方式回复的无毒查询。我们广泛的实验评估表明,我们的攻击对公开聊天机器人模型有效,并且优于先前工作中提出的手工制作的恶意查询。我们还针对 ToxicBuddy 评估了三种防御机制,表明它们要么以影响聊天机器人效用为代价降低攻击性能,要么仅能有效缓解部分攻击。这凸显了计算机安全和在线安全社区需要更多研究,以确保聊天机器人模型不会伤害其用户。总体而言,我们确信 ToxicBuddy 可用作审计工具,并且我们的工作将为设计更有效的聊天机器人安全防御铺平道路。
引用
@article{arxiv.2209.03463,
title = {Why So Toxic? Measuring and Triggering Toxic Behavior in Open-Domain Chatbots},
author = {Wai Man Si and Michael Backes and Jeremy Blackburn and Emiliano De Cristofaro and Gianluca Stringhini and Savvas Zannettou and Yang Zhang},
journal= {arXiv preprint arXiv:2209.03463},
year = {2022}
}