中文

使用 PRM 引导的候选选择与序贯优化缓解英语与乌尔都语语言模型中的社会偏见

计算与语言 2025-12-11 v1

摘要

大型语言模型(LLM)日益介导人类沟通、决策支持、内容创作与信息检索。尽管具有出色的流畅性,这些系统仍频繁产生带有偏见或刻板印象的内容,尤其是在面对涉及社会敏感语言的提示时。越来越多的研究表明,此类偏见对低资源语言的影响尤为严重,因为这些语言的训练数据有限且在文化上缺乏代表性。本文针对推理时偏见缓解进行了全面研究,该策略无需重新训练或微调,而是直接作用于模型输出。基于偏好排序模型(PRM),我们引入了一个统一的评估框架,比较了三种方法:(1)基线单字生成,(2)PRM-Select best-of-N 采样,以及(3)由 PRM 评判引导的 PRM-Sequential 序贯优化。我们在 200 个英语提示及其乌尔都语对应提示上评估了这些技术,这些提示旨在反映与性别、种族、宗教、国籍、残疾、职业、年龄和社会经济类别相关的社会文化背景。使用 GPT-3.5 作为候选生成器,GPT-4o-mini 作为基于 PRM 的偏见与效用评分器,我们对偏见降低、效用保持和跨语言差异进行了广泛的定量分析。我们的研究结果表明:(a)两种语言相较于基线均有显著提升;(b)所有方法中乌尔都语的公平性评分始终较低,凸显了多语言 LLM 训练中的结构性不平等;(c)PRM-Select 与 PRM-Sequential 之间存在截然不同的改进轨迹。本研究贡献了一种可扩展的方法论、可解释的指标以及跨语言比较,可支持未来关于低资源语言公平性评估的研究。

关键词

引用

@article{arxiv.2512.09854,
  title  = {Mitigating Social Bias in English and Urdu Language Models Using PRM-Guided Candidate Selection and Sequential Refinement},
  author = {Muneeb Ur Raheem Khan},
  journal= {arXiv preprint arXiv:2512.09854},
  year   = {2025}
}