KoSBi:面向更安全大语言模型应用的缓解社会偏见风险数据集
计算与语言
2023-05-31 v2
摘要
大语言模型(LLMs)不仅从真实世界数据中学习自然文本生成能力,还习得了针对不同类型人口群体的社会偏见。这在部署基于 LLM 的应用时带来了关键风险。由于语言和文化的差异(二者均显著影响偏见及目标人口群体),现有研究及资源在韩国难以直接适用。这一局限需要本地化的社会偏见数据集以确保 LLM 的安全有效部署。为此,我们提出 KO SB I,一个包含 34k 对韩语上下文与句子的新社会偏见数据集,覆盖 15 个类别下的 72 个人口群体。我们发现,通过基于过滤的审核,HyperCLOVA(30B 与 82B)及 GPT-3 生成内容中的社会偏见平均可降低 16.47%p。
引用
@article{arxiv.2305.17701,
title = {KoSBi: A Dataset for Mitigating Social Bias Risks Towards Safer Large Language Model Application},
author = {Hwaran Lee and Seokhee Hong and Joonsuk Park and Takyoung Kim and Gunhee Kim and Jung-Woo Ha},
journal= {arXiv preprint arXiv:2305.17701},
year = {2023}
}
备注
17 pages, 8 figures, 12 tables, ACL 2023