CBBQ:面向大语言模型的由人机协作构建的中文偏见基准数据集
计算与语言
2023-06-29 v1 人工智能
摘要
整体衡量大语言模型的社会偏见对于检测并降低高能力 AI 模型中的伦理风险至关重要。本工作中,我们提出一个中文偏见基准数据集,包含由人类专家与生成式语言模型共同构建的超过 10 万道问题,涵盖与中国文化和价值观相关的 14 个社会维度中的刻板印象与社会偏见。构建过程包含 4 个关键步骤:通过广泛文献综述进行偏见识别、歧义上下文生成、AI 辅助消歧上下文生成,以及人工审阅与重组。数据集中的测试实例由 3000 余个经严格质量控制人工编写的高质量模板自动派生而来。该数据集表现出广泛覆盖性与高多样性。大量实验证明了该数据集在检测模型偏见方面的有效性,所有 10 个公开可用的中文大语言模型均在特定类别中表现出强烈偏见。此外,我们从实验中观察到,微调模型在某种程度上可以遵循指令,并以“道德自我纠正”的方式避免生成某些类型中道德上有害的输出。我们的数据集与结果公开于 \href{https://github.com/YFHuangxxxx/CBBQ}{https://github.com/YFHuangxxxx/CBBQ},为更广泛的社区提供去偏研究机会。
引用
@article{arxiv.2306.16244,
title = {CBBQ: A Chinese Bias Benchmark Dataset Curated with Human-AI Collaboration for Large Language Models},
author = {Yufei Huang and Deyi Xiong},
journal= {arXiv preprint arXiv:2306.16244},
year = {2023}
}