中文

推理是否会引入偏见?对LLM推理中社会偏见评估与缓解的研究

计算与语言 2025-09-23 v3 人工智能

摘要

近期大语言模型(LLMs)的进展使得链式思维(co-chain-of-thought, CoT)推理的自动生成成为可能,在数学和代码等任务中取得了强大的性能。然而,当推理步骤反映社会偏见(例如关于性别、种族或年龄的偏见)时,可能加强有害关联,导致误导性结论。我们系统评估了LLM生成推理中的社会偏见,专注于产生推理链的语言模型(如DeepSeek-R1、OpenAI o1),这些模型在其答案中原生生成推理链。使用BBQ数据集,我们分析了预测准确率和推理偏见,涵盖广泛的模型,包括经过指令微调和CoT增强的DeepSeek-R1(8B/32B)、ChatGPT以及其他开源LLM。我们量化了偏见推理步骤与错误预测之间的关联,常常导致偏见表达。为缓解推理引起的偏见,我们提出了以答案分布作为偏见代理(Answer Distribution as Bias Proxy, ADBP)的轻量级缓解方法,通过跟踪模型预测在逐步推理中的变化来检测偏见。ADBP在大多数情况下优于Stereotype-free Reasoning Pattern(SfRP)基线,有效缓解了偏见并提高了LLM输出的准确率。评估和缓解代码已公开于https://github.com/elviswxy/LLM_reasoning_bias。

关键词

引用

@article{arxiv.2502.15361,
  title  = {Does Reasoning Introduce Bias? A Study of Social Bias Evaluation and Mitigation in LLM Reasoning},
  author = {Xuyang Wu and Jinming Nian and Ting-Ruen Wei and Zhiqiang Tao and Hsin-Tai Wu and Yi Fang},
  journal= {arXiv preprint arXiv:2502.15361},
  year   = {2025}
}

备注

EMNLP Findings