中文

心理健康支持中对话安全理解的基准

计算与语言 2023-08-01 v1

摘要

对话安全在开放域人机交互中仍是一个普遍存在的挑战。现有方法提出了独特的对话安全分类体系和数据集,用于检测显式有害回复。然而,这些分类体系可能不适合分析心理健康支持中的回复安全性。在真实世界交互中,在闲聊中被视为可接受的模型回复,对寻求心理健康支持的用户可能仅有微不足道的积极影响。为应对这些局限,本文旨在开发一个在理论和事实上均有依据、并优先考虑对求助者积极影响的分类体系。此外,我们创建了一个带有细粒度标签的基准语料库,以推动进一步研究。我们使用包括BERT-base、RoBERTa-large和ChatGPT在内的流行语言模型分析该数据集,以检测并理解心理健康支持语境中的不安全回复。我们的研究表明,ChatGPT在零样本和少样本范式下难以检测具有详细安全定义的安全类别,而微调模型则更为适用。所开发的 dataset 和发现可作为推动心理健康支持对话安全研究的宝贵基准,对改进真实应用中对话智能体的设计与部署具有重要意义。我们的代码和数据发布于此:https://github.com/qiuhuachuan/DialogueSafety。

关键词

引用

@article{arxiv.2307.16457,
  title  = {A Benchmark for Understanding Dialogue Safety in Mental Health Support},
  author = {Huachuan Qiu and Tong Zhao and Anqi Li and Shuai Zhang and Hongliang He and Zhenzhong Lan},
  journal= {arXiv preprint arXiv:2307.16457},
  year   = {2023}
}

备注

accepted to The 12th CCF International Conference on Natural Language Processing and Chinese Computing (NLPCC2023)