中文

通过激活引导探究Llama 2 Chat中的偏见表征

计算与语言 2024-02-02 v1 人工智能

摘要

我们探讨大型语言模型(LLM)中的社会偏见问题,重点关注 Llama 2 7B Chat 模型。随着 LLM 越来越多地被整合到具有重大社会影响的决策过程中,确保这些模型不会强化现有偏见变得至关重要。我们的方法采用激活引导来探测并缓解与性别、种族和宗教相关的偏见。该方法通过操纵模型激活值,利用源自 StereoSet 数据集和自定义 GPT4 生成的性别偏见提示的引导向量,将响应引导至或远离偏见输出。我们的发现揭示了 Llama 2 7B Chat 中固有的性别偏见,这种偏见在基于人类反馈的强化学习(RLHF)之后依然存在。我们还观察到偏见与模型拒绝响应的倾向之间存在可预测的负相关性。值得注意的是,我们的研究表明,RLHF 倾向于增加模型对不同形式社会偏见表征的相似性,这引发了对模型是否细致理解不同形式偏见的质疑。这项工作还为使用激活引导对 LLM 进行有效的红队测试策略提供了有价值的见解,特别强调了整合拒绝向量的重要性。

关键词

引用

@article{arxiv.2402.00402,
  title  = {Investigating Bias Representations in Llama 2 Chat via Activation Steering},
  author = {Dawn Lu and Nina Rimsky},
  journal= {arXiv preprint arXiv:2402.00402},
  year   = {2024}
}