中文

面向对话系统中社会偏见的识别:框架、数据集与基准

计算与语言 2022-10-31 v2

摘要

基于大规模语料训练的神经模型极大地推动了开放域对话系统的研究,然而此类语料常引入各类安全问题(例如攻击性语言、偏见和有毒行为),严重阻碍对话系统的实际部署。在所有这些不安全问题中,社会偏见的处理更为复杂,因其对边缘群体的负面影响通常以隐式方式表达,从而需要规范性推理与严格分析。本文聚焦于对话安全问题的社会偏见检测。我们首先提出一种新颖的 Dial-Bias 框架,用于从语用角度分析对话中的社会偏见,其考虑了比简单二分标注更为全面的相关偏见分析。基于所提框架,我们进一步引入 CDail-Bias 数据集,据我们所知,这是首个标注良好的中文社会偏见对话数据集。此外,我们建立了若干针对不同标签粒度和输入类型(语句级与上下文级)的对话偏见检测基准。我们表明,所提 Dial-Bias 框架中的深入分析连同这些基准对于偏见检测任务是必要且不可或缺的,并有助于在实践中构建安全的对话系统。

关键词

引用

@article{arxiv.2202.08011,
  title  = {Towards Identifying Social Bias in Dialog Systems: Frame, Datasets, and Benchmarks},
  author = {Jingyan Zhou and Jiawen Deng and Fei Mi and Yitong Li and Yasheng Wang and Minlie Huang and Xin Jiang and Qun Liu and Helen Meng},
  journal= {arXiv preprint arXiv:2202.08011},
  year   = {2022}
}