中文

“我不是种族主义者但……”:揭示大语言模型内部知识中的偏见

计算与语言 2023-10-16 v1 人工智能

摘要

大语言模型(LLMs)因其在不断扩展的自然语言处理任务中令人瞩目的表现而获得了广泛关注。然而,这些模型已被证明带有固有的社会偏见或刻板印象,这会对它们在众多下游应用中的表现产生不利影响。在本文中,我们提出了一种新颖的、纯基于提示的方法来揭示任意 LLM 中隐藏的刻板印象。我们的方法动态生成内部刻板印象的知识表示,从而能够识别编码在 LLM 内部知识中的偏见。通过阐明 LLM 中存在的偏见并提供系统性的分析方法,我们的工作有助于提升自然语言处理系统的透明度和促进公平性。

关键词

引用

@article{arxiv.2310.08780,
  title  = {"Im not Racist but...": Discovering Bias in the Internal Knowledge of Large Language Models},
  author = {Abel Salinas and Louis Penafiel and Robert McCormack and Fred Morstatter},
  journal= {arXiv preprint arXiv:2310.08780},
  year   = {2023}
}

备注

Warning: This paper discusses and contains content that is offensive or upsetting