大语言模型中刻板印象内容的分类法
计算机与社会
2024-08-02 v1 人工智能
计算与语言
机器学习
摘要
本研究提出了一种当代大语言模型(LLMs)中刻板印象内容的分类法。我们对 ChatGPT 3.5、Llama 3 和 Mixtral 8x7B 这三个强大且广泛使用的 LLM 进行了提示,询问与 87 个社会类别(如性别、种族、职业)相关的特征。我们识别出 14 个刻板印象维度(如道德、能力、健康、信仰、情感),涵盖了约 90% 的 LLM 刻板印象关联。温暖和能力维度最为常见,但其他所有维度也显著存在。LLM 中的刻板印象比人类更积极,但在类别和维度之间存在显著差异。最后,该分类法预测了 LLMs 对社会类别的内部评估(如类别被正面/负面表示的程度),支持了用多维分类法刻画 LLM 刻板印象的相关性。我们的发现表明,高维人类刻板印象在 LLMs 中有所反映,必须在 AI 审计和去偏中加以考虑,以最小化因依赖低维偏见视角而产生的未识别危害。
引用
@article{arxiv.2408.00162,
title = {A Taxonomy of Stereotype Content in Large Language Models},
author = {Gandalf Nicolas and Aylin Caliskan},
journal= {arXiv preprint arXiv:2408.00162},
year = {2024}
}