中文

通过可控逆向生成构建高诱导性对话安全上下文

计算与语言 2022-12-06 v1

摘要

大型预训练语言模型容易生成有毒或有偏内容,这在实用中是禁忌的。为检测此类有毒生成,现有方法依赖模板、真实数据抽取、众包工人或自动生成来构建可能引发有毒生成的对抗上下文。然而,何种类型的上下文更可能诱导不安全回复仍待探索。在本文中,我们识别出上下文毒性与上下文类别(如\textit{亵渎}、\textit{侮辱}、\textit{毒品}等)是导致回复生成中安全问题的两个重要因素。因此,我们提出一种称为\emph{逆向生成}的方法,以给定回复为条件构建对抗上下文,并可灵活控制所生成上下文的类别、毒性水平和诱导性。通过逆向生成,我们扩充了现有BAD数据集并构建了新数据集BAD+,其包含12个类别中超过120K的多样且高诱导性上下文。我们测试了三种流行的预训练对话模型(Blender、DialoGPT和Plato2),发现BAD+能大幅暴露它们的安全问题。此外,我们展示BAD+可极大增强生成的安全性并揭示安全提升的关键因素。我们的代码与数据集可在\url{https://github.com/thu-coai/Reverse_Generation}获取。

关键词

引用

@article{arxiv.2212.01810,
  title  = {Constructing Highly Inductive Contexts for Dialogue Safety through Controllable Reverse Generation},
  author = {Zhexin Zhang and Jiale Cheng and Hao Sun and Jiawen Deng and Fei Mi and Yasheng Wang and Lifeng Shang and Minlie Huang},
  journal= {arXiv preprint arXiv:2212.01810},
  year   = {2022}
}

备注

Findings of EMNLP 2022