面向 LLM 的偏见轮廓:情境词嵌入中的刻板印象维度
计算与语言
2025-01-14 v2
摘要
大型语言模型(LLM)是当前人工智能成功的基础,但它们不可避免地存在偏见。为了有效传达这些模型的风险并鼓励缓解措施,这些模型需要充分且直观的描述,这些描述适用于所有AI受众。我们提出了基于社会心理学研究中的词典,针对刻板印象维度构建偏见轮廓。在这些维度上,我们研究了情境嵌入中的性别偏见,跨越情境和层次,并为十二种不同的 LLM 生成了刻板印象轮廓,展示了其直观性和用于暴露和可视化偏见的用例。
引用
@article{arxiv.2411.16527,
title = {Profiling Bias in LLMs: Stereotype Dimensions in Contextual Word Embeddings},
author = {Carolin M. Schuster and Maria-Alexandra Dinisor and Shashwat Ghatiwala and Georg Groh},
journal= {arXiv preprint arXiv:2411.16527},
year = {2025}
}
备注
Accepted to NoDaLiDa/Baltic-HLT 2025