中文

显式与隐式:通过自我反思探究大语言模型中的社会偏见

计算与语言 2025-06-04 v4

摘要

大语言模型(LLMs)已在其生成内容中表现出多种偏见与刻板印象。尽管已有大量研究对 LLM 中的偏见进行了考察,但先前工作主要聚焦于显式偏见,而对隐式偏见以及这两种偏见形式之间的关系关注甚少。本文提出了一个基于社会心理学理论的系统化框架,以探究并比较 LLM 中的显式与隐式偏见。我们提出了一种新颖的基于自我反思(self-reflection)的评估框架,该框架分两阶段运行:首先通过模拟心理学评估方法测量隐式偏见,然后通过提示 LLM 分析其自身生成的内容来评估显式偏见。通过在多个社会维度上对先进 LLM 进行的大量实验,我们证明 LLM 在显式与隐式偏见之间表现出显著的不一致性:显式偏见表现为轻微的刻板印象,而隐式偏见则表现出强烈的刻板印象。我们进一步探究了导致这种显式-隐式偏见不一致性的潜在因素,考察了训练数据规模、模型规模以及对齐技术的影响。实验结果表明,随着训练数据与模型规模的增加,显式偏见有所下降,而隐式偏见则呈现相反的上升趋势。此外,当代对齐方法能有效抑制显式偏见,但在缓解隐式偏见方面效果有限。

关键词

引用

@article{arxiv.2501.02295,
  title  = {Explicit vs. Implicit: Investigating Social Bias in Large Language Models through Self-Reflection},
  author = {Yachao Zhao and Bo Wang and Yan Wang and Dongming Zhao and Ruifang He and Yuexian Hou},
  journal= {arXiv preprint arXiv:2501.02295},
  year   = {2025}
}

备注

Accepted by ACL 2025