利用上下文学习改善对话安全性
计算与语言
2023-10-24 v3
摘要
尽管基于大型神经网络的对话模型已成为日益熟练的对话智能体,近期研究凸显了此类系统的安全问题。例如,这些系统可被诱导生成有毒内容,往往固化社会偏见或刻板印象。我们研究了一种基于检索的方法,用于降低聊天机器人回复中的偏见与毒性。该方法利用上下文学习将模型导向更安全的生成。具体而言,针对不安全对话上下文生成回复时,我们检索针对相似对话上下文的安全回复示例。我们发现该方法无需训练即可与强基线竞争力相当。例如,通过自动评估,我们发现最佳微调基线仅比我们的方法对DiaSafety中不安全对话上下文多生成4.04%的安全回复。最后,我们还提出了一种重排序流程,可进一步改善回复安全性。
引用
@article{arxiv.2302.00871,
title = {Using In-Context Learning to Improve Dialogue Safety},
author = {Nicholas Meade and Spandana Gella and Devamanyu Hazarika and Prakhar Gupta and Di Jin and Siva Reddy and Yang Liu and Dilek Hakkani-Tür},
journal= {arXiv preprint arXiv:2302.00871},
year = {2023}
}
备注
Findings of EMNLP 2023