StereoMap:量化大语言模型中类人刻板印象的觉察程度
计算与语言
2023-11-01 v2
摘要
大语言模型(LLMs)被观察到会编码并延续训练数据中存在的有害关联。我们提出一个理论扎实的框架 StereoMap,以深入洞察它们对社会如何看待人口群体的认知。该框架立足于刻板印象内容模型(SCM),一个来自心理学的成熟理论。根据 SCM,刻板印象并非千篇一律。相反,温暖(Warmth)与能力(Competence)两个维度构成了刻画刻板印象性质的因素。基于 SCM 理论,StereoMap 利用温暖与能力维度映射 LLMs 对社会群体(由社会人口特征定义)的认知。此外,该框架能够考察 LLMs 判断的关键词与推理表述,以揭示影响其认知的潜在因素。我们的结果表明,LLMs 对这些群体表现出多样化的认知,其特征是在温暖与能力维度上的混合评价。进一步分析 LLMs 的推理,我们的发现表明 LLMs 表现出对社会差距的觉察,常陈述统计数据和研究发现以支持其推理。本研究增进了对 LLMs 如何感知和表征社会群体的理解,揭示了其潜在偏见与有害关联的延续。
引用
@article{arxiv.2310.13673,
title = {StereoMap: Quantifying the Awareness of Human-like Stereotypes in Large Language Models},
author = {Sullam Jeoung and Yubin Ge and Jana Diesner},
journal= {arXiv preprint arXiv:2310.13673},
year = {2023}
}
备注
Accepted to EMNLP 2023