中文

用于缓解大型语言模型中社会偏见的意图感知自我修正

计算与语言 2025-03-11 v1 人工智能

摘要

基于反馈的自我修正提高了大型语言模型(LLM)的输出质量。此外,从认知心理学的角度来看,由于自我修正的功能类似于缓慢且有意识的 System-2 思维,它有可能降低 LLM 的社会偏见。LLM 对上下文的歧义和不一致性很敏感;因此,在应用自我修正进行去偏时,在交互过程中明确传达其意图至关重要。在本研究中,我们证明了明确意图对于通过自我修正有效减少 LLM 中的偏见是必不可少的。我们将自我修正所需的组件分为三部分:指令、回复和反馈,并在每个组件中明确意图。我们引入了显式的去偏提示,以从指令中传达生成回复时的偏见缓解意图。在回复中,我们使用思维链来阐明推理过程。在反馈中,我们定义了去偏所需的评估方面,并通过多方面批评和评分提出明确的反馈。通过实验,我们证明了与基线相比,基于多方面反馈从去偏提示中获得的自我修正 CoT 回复能够更稳健、更一致地减少有偏见的回复。我们还发现,当使用具有不同偏见水平的模型或将回复生成与反馈生成分离到不同模型时,去偏效果存在差异。

关键词

引用

@article{arxiv.2503.06011,
  title  = {Intent-Aware Self-Correction for Mitigating Social Biases in Large Language Models},
  author = {Panatchakorn Anantaprayoon and Masahiro Kaneko and Naoaki Okazaki},
  journal= {arXiv preprint arXiv:2503.06011},
  year   = {2025}
}

备注

18 pages. Under review