关于对话模型的安全性:分类体系、数据集与基准
计算与语言
2022-04-05 v2
摘要
对话安全问题严重限制了神经对话模型在现实世界中的部署,并近期引起了极大的研究兴趣。然而,对话安全问题仍缺乏明确定义,且相应数据集稀缺。我们提出了一种专为捕捉人机对话设定中不安全行为而设计的对话安全分类体系,重点关注上下文敏感的不安全性,这是先前工作未充分探索的。为推动该方向研究,我们构建了DiaSafety,一个包含丰富上下文敏感不安全示例的数据集。实验表明,现有安全防护工具在我们的数据集上严重失效。作为补救,我们训练了一个对话安全分类器,为上下文敏感对话不安全检测提供强基线。借助我们的分类器,我们对流行对话模型进行了安全性评估,并表明现有对话系统仍表现出令人担忧的上下文敏感安全问题。
引用
@article{arxiv.2110.08466,
title = {On the Safety of Conversational Models: Taxonomy, Dataset, and Benchmark},
author = {Hao Sun and Guangxuan Xu and Jiawen Deng and Jiale Cheng and Chujie Zheng and Hao Zhou and Nanyun Peng and Xiaoyan Zhu and Minlie Huang},
journal= {arXiv preprint arXiv:2110.08466},
year = {2022}
}
备注
Accepted to Findings of ACL 2022 (Long Paper)