DR.GAP:使用性别感知提示结合演示与推理来缓解大型语言模型中的偏见
计算与语言
2025-02-18 v1 人工智能
摘要
大型语言模型(LLM)具有强大的自然语言处理能力,但也继承并放大了包括性别偏见在内的社会偏见,引发公平性 concerns。现有的去偏方法面临显著限制:参数调优需要获取模型权重,基于提示的方法常会降低模型效用,而优化方法缺乏通用性。为此,我们提出了 DR.GAP(Demonstration and Reasoning for Gender-Aware Prompting),一种自动化且不依赖模型的做法,通过性别感知提示实现偏见缓解,同时保持模型性能。DR.GAP 选择揭示偏见的示例并生成结构化推理,以引导模型 toward更为公正的响应。广泛实验表明,在核心指代消解和问答任务中,DR.GAP 对多个 LLM(GPT-3.5、Llama3 和 Llama2-Alpaca)有效,具备良好的推广能力和鲁棒性。DR.GAP 还能推广到视觉语言模型(VLM),实现显著的偏见降低。
引用
@article{arxiv.2502.11603,
title = {DR.GAP: Mitigating Bias in Large Language Models using Gender-Aware Prompting with Demonstration and Reasoning},
author = {Hongye Qiu and Yue Xu and Meikang Qiu and Wenjie Wang},
journal= {arXiv preprint arXiv:2502.11603},
year = {2025}
}