Auto-Search and Refinement:大语言模型中性别偏见缓解的自动化框架
计算与语言
2025-11-04 v3 人工智能
摘要
在广大文本语料库上预训练大型语言模型(LLM)可以提升自然语言处理能力,但也会风险地编码社会偏见,尤其是性别偏见。虽然参数修改方法如微调能够缓解偏见,但耗费资源、不适用于闭源模型,且缺乏对不断演变的社会规范的适应性。指令化方法具有灵活性,但常常损害任务性能。为克服这些限制,本文提出 ,一种自动化且与模型无关的框架,采用 范式来自适应生成 Fairwords,这些 Fairwords 作为整合到输入查询中的指令,以减少性别偏见并提升响应质量。大量实验表明,FaIRMaker 能够自动搜索并动态细化 Fairwords,有效缓解性别偏见,同时保持任务完整性,确保与基于 API 的和开源 LLM 兼容。
引用
@article{arxiv.2502.11559,
title = {Auto-Search and Refinement: An Automated Framework for Gender Bias Mitigation in Large Language Models},
author = {Yue Xu and Chengyan Fu and Li Xiong and Sibei Yang and Wenjie Wang},
journal= {arXiv preprint arXiv:2502.11559},
year = {2025}
}
备注
Accepted to NeurIPS 2025