PRIDE -- 面向平等性的LLM身份歧视参数高效降低
计算与语言
2025-07-21 v1 计算机与社会
摘要
大型语言模型(LLM)经常复现其训练语料中内嵌的性别和性取向偏见,导致对LGBTQIA+用户的输出产生边缘化。因此,降低此类偏见至关重要。为此,我们评估了两种参数高效微调(PEFT)技术——低秩适应(LoRA)和软提示调优——作为全模型微调的轻量级替代方案,用于缓解此类偏见。使用WinoQueer基准,我们对三个开源LLM进行偏差量化,观察到基线偏差得分在最高可达100分(满分100分)的 queer 身份(基于性别和/或性取向)范围内,其中50分表示中性。使用LoRA(<0.1%额外参数)在精选的QueerNews语料库上微调,可将这些得分降低最高可达50分,并将中性从几乎0%提升至最高可达36%。软提示调优(10个虚拟token)仅提供有限的改进。这些发现表明,LoRA能够以最小计算资源实现显著的公平性提升。我们主张更广泛地采用社区信息驱动的PEFT,创建更大的 queer 作者语料库,以及超越WinoQueer的更丰富的评估套件,配合持续的审计,以保持LLM的包容性。
引用
@article{arxiv.2507.13743,
title = {PRIDE -- Parameter-Efficient Reduction of Identity Discrimination for Equality in LLMs},
author = {Maluna Menke and Thilo Hagendorff},
journal= {arXiv preprint arXiv:2507.13743},
year = {2025}
}