中文

注意力胜千言:语言模型中偏见的定位与缓解

计算与语言 2024-10-31 v1 人工智能 机器学习

摘要

我们探索了当大语言模型(LLMs)接收到模糊比较提示时,偏见如何在其内部机制中产生:这些提示比较或强制在两个或多个实体之间做出选择,而未提供明确的偏好上下文。大多数偏见缓解方法侧重于事后分析或数据增强。然而,这些都是暂时性的解决方案,并未解决根本原因:模型本身。许多先前的研究表明,注意力模块对引导生成具有影响。我们认为,分析注意力对于理解偏见也至关重要,因为它能洞察LLM如何在不同实体间分配其关注度,以及这如何导致有偏见的决策。为此,我们首先引入一个度量标准来量化LLM对一个实体相对于另一个实体的偏好。然后,我们提出ATLAS\texttt{ATLAS}(基于注意力的目标层分析与缩放),这是一种通过分析注意力分数将偏见定位到LLM特定层,然后通过缩放这些偏见层中的注意力来减少偏见的技术。为了评估我们的方法,我们使用GPT-2 XL\texttt{GPT-2 XL}(1.5B)、GPT-J\texttt{GPT-J}(6B)、LLaMA-2\texttt{LLaMA-2}(7B)和LLaMA-3\texttt{LLaMA-3}(8B)在3个数据集(BBQ、Crows-Pairs和WinoGender)上进行了实验。我们的实验表明,偏见集中在模型的后期层,通常位于最后三分之一左右。我们还展示了ATLAS\texttt{ATLAS}如何通过有针对性的干预有效缓解偏见,同时不损害下游性能,并且在应用干预时困惑度平均仅增加0.82%。我们在所有数据集上的偏见分数平均提高了0.28分。

关键词

引用

@article{arxiv.2410.22517,
  title  = {Attention Speaks Volumes: Localizing and Mitigating Bias in Language Models},
  author = {Rishabh Adiga and Besmira Nushi and Varun Chandrasekaran},
  journal= {arXiv preprint arXiv:2410.22517},
  year   = {2024}
}