CHBias:中文对话语言模型的偏见评估与缓解
计算与语言
2023-05-22 v1
摘要
\textit{\textbf{\textcolor{red}{警告}:} 本文包含可能令人不适或不安的内容。} 预训练对话智能体已暴露出安全问题,表现出一系列刻板的人类偏见,如性别偏见。然而当前研究中的偏见类别仍有限,且大多仅关注英文。本文引入一个新的中文数据集 CHBias,用于中文对话语言模型的偏见评估与缓解。除先前充分探索的偏见类别外,CHBias 包含了较少受关注的未充分探索偏见类别,如年龄歧视与外貌偏见。我们使用 CHBias 评估了两个流行的预训练中文对话模型 CDial-GPT 与 EVA2.0。此外,为缓解不同偏见,我们将若干去偏方法应用于中文预训练模型。实验结果表明,这些中文预训练模型在生成含社会偏见的文本方面存在潜在风险,且使用所提数据集的去偏方法能在保持模型对话能力的同时使回复生成偏见更少。
引用
@article{arxiv.2305.11262,
title = {CHBias: Bias Evaluation and Mitigation of Chinese Conversational Language Models},
author = {Jiaxu Zhao and Meng Fang and Zijing Shi and Yitong Li and Ling Chen and Mykola Pechenizkiy},
journal= {arXiv preprint arXiv:2305.11262},
year = {2023}
}
备注
Accepted by ACL 2023