未被言说之事仍伤人:基于描述的评估框架用于衡量大语言模型中的社会偏见
计算与语言
2025-09-18 v2
摘要
大语言模型(LLM)常常继承其训练数据中的社会偏见。虽然现有基准通过基于术语的方式评估偏见——即通过人口统计术语与偏见术语之间的直接关联来评估偏见——但 LLM 正变得越来越擅长规避有偏见的响应,从而表现出看似偏见较低的水平。然而,偏见仍以更细微、情境隐藏的形式存在,这些细微形式的偏见传统基准未能捕捉。我们引入描述基准(Description-based Bias Benchmark,DBB),这是一个新设计的数据集,用于在语义层面评估偏见——偏见概念隐藏在真实场景中以自然、微妙方式呈现,而非表面术语。我们分析了六个最先进的 LLM,揭示了模型在响应层面减少了偏见,但在细致环境中继续强化偏见。数据、代码和结果均可在 https://github.com/JP-25/Description-based-Bias-Benchmark 获取。
引用
@article{arxiv.2502.19749,
title = {What's Not Said Still Hurts: A Description-Based Evaluation Framework for Measuring Social Bias in LLMs},
author = {Jinhao Pan and Chahat Raj and Ziyu Yao and Ziwei Zhu},
journal= {arXiv preprint arXiv:2502.19749},
year = {2025}
}
备注
EMNLP Findings 2025