中文

对齐什么?RLHF 对齐的局限性

计算与语言 2025-03-13 v1

摘要

基于人类反馈的强化学习(RLHF)正日益被用于使大语言模型(LLM)与人类偏好对齐。然而,RLHF 在解决潜在偏见方面的有效性仍不明确。本研究调查了 RLHF 与 LLM 中隐性及显性偏见之间的关系,特别关注针对非裔美国人的偏见。我们对 Llama 3 8B 应用了多种 RLHF 技术(DPO、ORPO 和 RLOO),并使用配对语域探测和显性偏见测试评估了所得模型的隐性及显性偏见。我们在不同的基础模型和数据集上使用 DPO 进行了额外测试;在多项发现中,我们观察到 RLHF 之前的监督微调(SFT)会使模型偏见固化。此外,我们将测量偏见的工具扩展到了多模态模型。通过实验,我们收集的证据表明,当前的对齐技术对于缓解隐性偏见等模糊任务是不充分的,凸显了对有能力的数据集、数据筛选技术或对齐工具的需求。

关键词

引用

@article{arxiv.2503.09025,
  title  = {Aligning to What? Limits to RLHF Based Alignment},
  author = {Logan Barnhart and Reza Akbarian Bafghi and Stephen Becker and Maziar Raissi},
  journal= {arXiv preprint arXiv:2503.09025},
  year   = {2025}
}