中文

情境 StereoSet:实验室基准下的偏见对齐鲁棒性压力测试

计算与语言 2026-01-16 v1 人工智能 计算机与社会 机器学习

摘要

在实验室基准中避免刻板印iet的模型,可能并未在部署时避免。我们展示,当提示提及不同的地点、时间或受众时,测得的偏见会发生剧烈变化——无需对抗性提示。我们引入情境 StereoSet(Contextual StereoSet),该基准在保持刻板印象内容固定的同时,系统性地变化情境框架。测试 13 个模型,发现显著模式:以 1990 年(相对于 2030 年)锚定,使所有测试模型在该对比下的刻板印象选择率均显著上升(p<0.05); gossip 框架在 5 个 6 个完整网格模型中均提升了刻板印象选择率;外群观察者框架可使其提升最高达 13 个百分点。这些效应在招聘、信贷和求助情境中均得到复制。我们提出情境敏感性指纹(Context Sensitivity Fingerprints, CSF):一种概括性概述,包含每个维度的离散程度及其与置信区间经 bootstrap 抽样后经 FDR 校正的配对对比。两种评估轨迹支持不同用例——一种是 360 个情境的诊断网格,用于深入分析,另一种是覆盖 4229 项的预算化协议,用于生产筛查。其意义在于方法论:固定条件下的偏见得分可能无法概括。这并非关于真实偏见率的论断,而是对评估鲁棒性的压力测试。CSF 迫使评估者问:"偏见在何种条件下才会显现?"而不是:"该模型是否偏见?"我们发布了基准数据集、代码及结果。

关键词

引用

@article{arxiv.2601.10460,
  title  = {Contextual StereoSet: Stress-Testing Bias Alignment Robustness in Large Language Models},
  author = {Abhinaba Basu and Pavan Chakraborty},
  journal= {arXiv preprint arXiv:2601.10460},
  year   = {2026}
}