中文

大语言模型中刻板印象内容的分类法

计算机与社会 2024-08-02 v1 人工智能 计算与语言 机器学习

摘要

本研究提出了一种当代大语言模型(LLMs)中刻板印象内容的分类法。我们对 ChatGPT 3.5、Llama 3 和 Mixtral 8x7B 这三个强大且广泛使用的 LLM 进行了提示,询问与 87 个社会类别(如性别、种族、职业)相关的特征。我们识别出 14 个刻板印象维度(如道德、能力、健康、信仰、情感),涵盖了约 90% 的 LLM 刻板印象关联。温暖和能力维度最为常见,但其他所有维度也显著存在。LLM 中的刻板印象比人类更积极,但在类别和维度之间存在显著差异。最后,该分类法预测了 LLMs 对社会类别的内部评估(如类别被正面/负面表示的程度),支持了用多维分类法刻画 LLM 刻板印象的相关性。我们的发现表明,高维人类刻板印象在 LLMs 中有所反映,必须在 AI 审计和去偏中加以考虑,以最小化因依赖低维偏见视角而产生的未识别危害。

关键词

引用

@article{arxiv.2408.00162,
  title  = {A Taxonomy of Stereotype Content in Large Language Models},
  author = {Gandalf Nicolas and Aylin Caliskan},
  journal= {arXiv preprint arXiv:2408.00162},
  year   = {2024}
}