从红队测试中学习:大语言模型中的性别偏见诱发与缓解
计算与语言
2023-10-18 v1 人工智能
摘要
近来,随着ChatGPT和GPT-4等大语言模型(LLMs)的进展,研究者在对话系统上取得了显著改进。这些基于LLM的聊天机器人编码了潜在偏见,并保留了可能在交互中伤害人类的差异。传统的偏见调查方法常依赖人工撰写的测试用例。然而,这些测试用例通常昂贵且有限。本工作中,我们提出一种首创方法,自动生成测试用例以检测LLM的潜在性别偏见。我们将该方法应用于三个知名LLM,发现生成的测试用例有效识别了偏见的存在。为应对所识别的偏见,我们提出一种缓解策略,使用生成的测试用例作为上下文学习(in-context learning)的示范,以避免参数微调的需要。实验结果显示,采用所提方法的LLM生成了更公平的回复。
引用
@article{arxiv.2310.11079,
title = {Learning from Red Teaming: Gender Bias Provocation and Mitigation in Large Language Models},
author = {Hsuan Su and Cheng-Chu Cheng and Hua Farn and Shachi H Kumar and Saurav Sahay and Shang-Tse Chen and Hung-yi Lee},
journal= {arXiv preprint arXiv:2310.11079},
year = {2023}
}