多奖励GRPO精调去偏大语言模型:基于中文语境判别数据的研究
计算与语言
2025-11-11 v1
摘要
大语言模型(LLMs)常表现出隐式偏见和歧视倾向,反映底层社会偏 Stereotype。虽然近期对齐技术如RLHF和DPO在一定程度上缓解了这些问题,但在解决文化特定性和多维度形式的歧视方面仍受限。本文提出了多奖励组相对策略优化(GRPO)框架,用于精调大语言模型以实现伦理和无偏见行为。我们的方法构建了一个源自中文语境歧视类别的合成英文数据集,包括地区、民族和职业偏见。每个实例配对中性和偏见性响应,以DeBERTa-v3为基础训练奖励模型,提供捕捉公平性、中性性和语言质量的多维奖励信号。训练好的奖励模型随后指导GRPO精调,在这些伦理维度上优化模型输出。实验结果显示,偏见强度显著降低,符合非歧视标准的对齐性得到提升,同时不损害流畅性或信息性。该研究突显了基于GRPO的多奖励优化去偏大语言模型的有效性,并提供了一个可复制的文化语境伦理对齐框架。
引用
@article{arxiv.2511.06023,
title = {Multi-Reward GRPO Fine-Tuning for De-biasing Large Language Models: A Study Based on Chinese-Context Discrimination Data},
author = {Deng Yixuan and Ji Xiaoqiang},
journal= {arXiv preprint arXiv:2511.06023},
year = {2025}
}