中文

StereoMap:量化大语言模型中类人刻板印象的觉察程度

计算与语言 2023-11-01 v2

摘要

大语言模型(LLMs)被观察到会编码并延续训练数据中存在的有害关联。我们提出一个理论扎实的框架 StereoMap,以深入洞察它们对社会如何看待人口群体的认知。该框架立足于刻板印象内容模型(SCM),一个来自心理学的成熟理论。根据 SCM,刻板印象并非千篇一律。相反,温暖(Warmth)与能力(Competence)两个维度构成了刻画刻板印象性质的因素。基于 SCM 理论,StereoMap 利用温暖与能力维度映射 LLMs 对社会群体(由社会人口特征定义)的认知。此外,该框架能够考察 LLMs 判断的关键词与推理表述,以揭示影响其认知的潜在因素。我们的结果表明,LLMs 对这些群体表现出多样化的认知,其特征是在温暖与能力维度上的混合评价。进一步分析 LLMs 的推理,我们的发现表明 LLMs 表现出对社会差距的觉察,常陈述统计数据和研究发现以支持其推理。本研究增进了对 LLMs 如何感知和表征社会群体的理解,揭示了其潜在偏见与有害关联的延续。

关键词

引用

@article{arxiv.2310.13673,
  title  = {StereoMap: Quantifying the Awareness of Human-like Stereotypes in Large Language Models},
  author = {Sullam Jeoung and Yubin Ge and Jana Diesner},
  journal= {arXiv preprint arXiv:2310.13673},
  year   = {2023}
}

备注

Accepted to EMNLP 2023