基于所需分布视角下的大语言模型偏好检测与缓解
计算与语言
2025-10-09 v1
摘要
尽管偏好缓解的 prior 工作关注促进社会平等和人口统计学公平,但对将LLM输出对齐至所需分布的注意力较少。例如,我们可能希望模型与真实世界分布相匹配以支持事实 grounding。因此,我们将偏好定义为偏离所需分布的现象,这可能是均等分布或真实世界分布,取决于应用目标。我们提出一种基于加权自适应损失的微调方法,将LLM的性别-职业输出分布与所需分布对齐,同时保持语言建模能力。使用3个职业集合——男性主导、女性主导和性别平衡——源自美国劳动统计局(2024年),我们评估了我们的自适应方法反映现实情况以及非自适应变体实现平等的效果。在三个掩码语言模型上,均观察到两种分布下的偏好。我们在实现平等下实现了近乎完全的缓解,在真实世界环境下实现了30-75%的减缓。自回归LLM在平等下无偏好,但在真实世界环境下存在显著偏好,Llama Instruct模型(3.2-3B, 3.1-8B)实现了50-62%的减缓。
引用
@article{arxiv.2510.06354,
title = {LLM Bias Detection and Mitigation through the Lens of Desired Distributions},
author = {Ingroj Shrestha and Padmini Srinivasan},
journal= {arXiv preprint arXiv:2510.06354},
year = {2025}
}
备注
Accepted to EMNLP 2025