中文

解码时间去偏:基于过程奖励模型的方法——从受控填空到开放式生成

计算与语言 2026-05-05 v1 机器学习

摘要

大语言模型会从其训练数据中捕获社会偏见,并将这些偏见传递到下游应用中,常常强化围绕性别、种族、宗教、残疾、年龄和社会经济地位的刻板印�。标准修复方法(在精选数据上重新训练或通过人类反馈进行微调)成本高昂,需要获取模型权重,并且可能损害模型在其他任务上的表现。在本文中,我们采取另一条路线:在解码时去偏,将偏见缓解视为对候选 token 的结构化搜索,而无需触及模型权重。一个独立的过程奖励模型(PRM)作为评姗,对每个候选 token 对公平性和流畅性进行评分。我们设计了三个日益复杂的方案(最佳-N 选择、顺序批判-修订、宪法自审),并在四个模型(GPT-4o-mini、Llama 3.2 3B、Gemma 3 4B、Qwen 2.5 3B)上进行评估,覆盖来自英语和乌尔都语的 200 个 prompt,涵盖八个偏见类别。顺序去偏最为有效,通过最高多达 +0.40 分提升平均偏见分数,同时保持(甚至时有时提升)流畅性。我们随后将所有三个方案扩展到开放式生成,在每个 token 上进行去偏,并引入一个轻量级的偏见警卫门,只在潜在偏见词汇上触发,保持开销接近 2 倍于经过校准的模型。一个形式化的开销指标将生成器成本与评判成本分开,可见最佳-N 在本机实现中几乎不产生额外生成器开销。GPT-4o-mini 作为一个强大的专有锚点,确认该框架随模型能力规模;三个开源模型显示当前小规模 LLM 仍的局限所在。

关键词

引用

@article{arxiv.2605.02348,
  title  = {Decoding-Time Debiasing via Process Reward Models: From Controlled Fill-in to Open-Ended Generation},
  author = {Muneeb Ur Raheem Khan},
  journal= {arXiv preprint arXiv:2605.02348},
  year   = {2026}
}

备注

28 pages, 19 figures, preprint