中文

生成式语言模型表现出社会认同偏见

计算与语言 2024-06-18 v2 计算机与社会

摘要

大型语言模型的流行激增引发了人们对其可能从人类处习得偏见的担忧。我们调查了来自社会心理学的根本社会认同偏见——内群体团结与外群体敌意——是否存在于 56 个大型语言模型中。我们发现,几乎所有基础语言模型以及一些指令微调模型在被提示补全句子(例如“我们是……”)时,都表现出明确的内群体正向与外群体负向关联。我们的发现表明,现代语言模型表现出与人类相似程度的根本社会认同偏见,无论是在实验室中还是在与 LLM 的真实对话中,并且策划训练数据与指令微调可缓解此类偏见。我们的结果对创建偏见更少的大型语言模型具有实际意义,并进一步强调了需要更多关于用户与 LLM 交互的研究,以防止人类中潜在的偏见强化。

关键词

引用

@article{arxiv.2310.15819,
  title  = {Generative Language Models Exhibit Social Identity Biases},
  author = {Tiancheng Hu and Yara Kyrychenko and Steve Rathje and Nigel Collier and Sander van der Linden and Jon Roozenbeek},
  journal= {arXiv preprint arXiv:2310.15819},
  year   = {2024}
}

备注

supplementary material, data, and code see https://osf.io/9ht32/?view_only=f0ab4b23325f4c31ad3e12a7353b55f5