中文

通过大语言模型条件文本生成探查显式与隐式性别偏见

计算与语言 2023-11-02 v1

摘要

大语言模型(LLMs)可能生成带有偏见和有害的回复。然而,大多数先前关于LLM性别偏见评估的工作需要预定义的性别相关短语或性别刻板印象,这些难以被全面收集且局限于显式偏见评估。此外,我们认为即便输入中不含性别相关语言或显式刻板印象,仍可能诱发LLM中的性别偏见。因此,在本工作中,我们提出一种无需预定义性别短语与刻板印象的条件文本生成机制。该方法采用通过三种不同策略生成的三类输入来探查LLM,旨在展示LLM中显式与隐式性别偏见的证据。我们还利用显式与隐式评估指标,在不同策略下评估LLM的性别偏见。我们的实验表明,模型规模增大并不总带来公平性的提升,且所有被测LLM均表现出显式和/或隐式性别偏见,即便输入中不存在显式性别刻板印象。

关键词

引用

@article{arxiv.2311.00306,
  title  = {Probing Explicit and Implicit Gender Bias through LLM Conditional Text Generation},
  author = {Xiangjue Dong and Yibo Wang and Philip S. Yu and James Caverlee},
  journal= {arXiv preprint arXiv:2311.00306},
  year   = {2023}
}

备注

Accepted in Socially Responsible Language Modelling Research (SoLaR) 2023 at NeurIPS 2023; the first two authors contribute equally