中文

基于强化学习的聊天机器人攻击性语义审查系统

计算与语言 2022-07-22 v1

摘要

人工智能(AI)技术的快速发展使大规模 AI 应用得以落地市场与实践。然而,AI 技术在产品化过程中为人们带来诸多便利的同时,也暴露出许多安全问题。尤其是针对聊天机器人在线学习漏洞的攻击频繁发生。因此,本文提出一种基于强化学习的语义审查聊天机器人系统,主要由两部分组成:攻击性语义审查模型与语义净化模型。攻击性语义审查可结合用户输入句子的上下文,检测快速演化的攻击性语义并应对攻击性语义回复。语义净化模型针对聊天机器人模型已被大量攻击性语义污染的情况,通过强化学习算法学到的攻击性回复加以处理,而非回滚至早期版本。此外,通过集成一次性学习(once-through learning)方法,在减少对回复质量影响的同时加快了语义净化速度。实验结果表明,我们提出的方法降低了聊天模型生成攻击性回复的概率,且少样本学习算法的集成在有效减缓 BLEU 值下降的同时迅速提升了训练速度。

关键词

引用

@article{arxiv.2207.10569,
  title  = {A Reinforcement Learning-based Offensive semantics Censorship System for Chatbots},
  author = {Shaokang Cai and Dezhi Han and Zibin Zheng and Dun Li and NoelCrespi},
  journal= {arXiv preprint arXiv:2207.10569},
  year   = {2022}
}