中文

利用上下文学习改善对话安全性

计算与语言 2023-10-24 v3

摘要

尽管基于大型神经网络的对话模型已成为日益熟练的对话智能体,近期研究凸显了此类系统的安全问题。例如,这些系统可被诱导生成有毒内容,往往固化社会偏见或刻板印象。我们研究了一种基于检索的方法,用于降低聊天机器人回复中的偏见与毒性。该方法利用上下文学习将模型导向更安全的生成。具体而言,针对不安全对话上下文生成回复时,我们检索针对相似对话上下文的安全回复示例。我们发现该方法无需训练即可与强基线竞争力相当。例如,通过自动评估,我们发现最佳微调基线仅比我们的方法对DiaSafety中不安全对话上下文多生成4.04%的安全回复。最后,我们还提出了一种重排序流程,可进一步改善回复安全性。

关键词

引用

@article{arxiv.2302.00871,
  title  = {Using In-Context Learning to Improve Dialogue Safety},
  author = {Nicholas Meade and Spandana Gella and Devamanyu Hazarika and Prakhar Gupta and Di Jin and Siva Reddy and Yang Liu and Dilek Hakkani-Tür},
  journal= {arXiv preprint arXiv:2302.00871},
  year   = {2023}
}

备注

Findings of EMNLP 2023