中文

偏差与波动性:评估大语言模型刻板印象及相关生成不一致性的统计框架

计算与语言 2025-05-27 v5 计算机与社会

摘要

我们提出了一个新颖的统计框架,通过系统估计大语言模型(LLM)生成中的偏差和变异来分析其刻板印象。当前的 alignment 评估指标常常忽视由 LLM 不一致的生成行为导致的刻板印象随机性。例如,对于相同的职业,LLM 可能在不同语境中表现出矛盾的刻板印象,例如与性别或种族相关的刻板印象。忽略这种不一致性可能导致 alignment 评估中得出误导性结论,并破坏评估 LLM 延续或放大社会偏见和不公平的潜力的努力。为了解决这个问题,我们提出了偏差-波动性框架(BVF),该框架估计 LLM 输出中刻板印象的概率分布。通过捕捉生成行为的变异,BVF 评估了 LLM 输出对弱势群体产生负面影响的可能性和程度,从而能够量化聚合的歧视风险。此外,我们引入了一个数学框架,将该风险分解为偏差风险(来自刻板印象分布的均值)和波动性风险(来自其变异)。将 BVF 应用于 12 个广泛使用的 LLM,我们发现:i) 偏差风险是歧视的主要贡献者;ii) 大多数 LLM 在几乎所有职业中都表现出显著的亲男性刻板印象;iii) 来自人类反馈的强化学习减少了偏差但增加了波动性;iv) 歧视风险与社会经济因素(如职业薪资)相关。最后,我们强调了 BVF 在评估 LLM 生成不一致性如何影响刻板印象之外的行为方面的更广泛适用性。

关键词

引用

@article{arxiv.2402.15481,
  title  = {Bias and Volatility: A Statistical Framework for Evaluating Large Language Model's Stereotypes and the Associated Generation Inconsistency},
  author = {Yiran Liu and Ke Yang and Zehan Qi and Xiao Liu and Yang Yu and ChengXiang Zhai},
  journal= {arXiv preprint arXiv:2402.15481},
  year   = {2025}
}