中文

利用社会感知对比学习提升对话安全性

计算与语言 2024-02-02 v1

摘要

最先进的对话式人工智能系统引发了担忧,因为它们存在生成不安全、有毒、不道德或危险内容的潜在风险。先前的工作开发了数据集,以教导对话代理适当的社会范式,从而有效应对专门设计的危险内容。然而,在这些对抗性数据集上训练的模型仍然难以识别对话中自然出现的微妙不安全情况,或在随意的语境中引入不恰当的回复。为了解这一问题的严重程度,我们研究了对抗性和随意对话语境中的亲社会性,并审计了通用语言模型在产生不安全内容倾向方面的回复质量。我们提出了一种双步微调过程,使用社会感知的n对对比损失来解决这些问题。随后,我们通过利用Moral Integrity Corpus (MIC) 和ProsocialDialog等数据集,训练了一个整合亲社会行为的基础模型。在多个对话数据集上的实验结果证明了我们的方法在生成社会恰当回复方面的有效性。

关键词

引用

@article{arxiv.2402.00446,
  title  = {Improving Dialog Safety using Socially Aware Contrastive Learning},
  author = {Souvik Das and Rohini K. Srihari},
  journal= {arXiv preprint arXiv:2402.00446},
  year   = {2024}
}

备注

SCI-CHAT@EACL2024