中文

面向 LLM 的偏见轮廓:情境词嵌入中的刻板印象维度

计算与语言 2025-01-14 v2

摘要

大型语言模型(LLM)是当前人工智能成功的基础,但它们不可避免地存在偏见。为了有效传达这些模型的风险并鼓励缓解措施,这些模型需要充分且直观的描述,这些描述适用于所有AI受众。我们提出了基于社会心理学研究中的词典,针对刻板印象维度构建偏见轮廓。在这些维度上,我们研究了情境嵌入中的性别偏见,跨越情境和层次,并为十二种不同的 LLM 生成了刻板印象轮廓,展示了其直观性和用于暴露和可视化偏见的用例。

关键词

引用

@article{arxiv.2411.16527,
  title  = {Profiling Bias in LLMs: Stereotype Dimensions in Contextual Word Embeddings},
  author = {Carolin M. Schuster and Maria-Alexandra Dinisor and Shashwat Ghatiwala and Georg Groh},
  journal= {arXiv preprint arXiv:2411.16527},
  year   = {2025}
}

备注

Accepted to NoDaLiDa/Baltic-HLT 2025