面向LLM的偏见诱发问题自适应生成
计算机与社会
2025-10-16 v1 人工智能
摘要
大规模语言模型(LLM)已广泛部署于面向用户的应用中,覆盖数亿用户。随着其融入日常任务,用户对其输出的依赖日益增长,引发显著关切。尤其是,用户可能无意中接触到模型固有的偏见,这些偏见系统性地不利或刻画特定群体。然而,现有偏见基准仍依赖模板化提示或限制性多选题,这些提示suggestive、简单化,且未能捕捉真实用户交互的复杂性。本文通过引入一个反事实偏见评估框架,自动生成针对敏感属性(如性别、种族或宗教)的真实、开放式问题。通过迭代变异和筛选偏见诱发问题,本方法系统性地探索模型最易产生偏见的领域。除检测有害偏见外,我们还捕捉了 increasingly relevant的用户交互维度,如非对称拒绝和对偏见的明确承认。基于本框架,我们构建了CAB—a个经过人工验证的基准,涵盖多样主题,旨在支持跨模型比较。使用CAB,我们分析了多种LLM在多个偏见维度上的表现,揭示了不同模型呈现偏见的细微差异。例如,尽管GPT-5在其他模型中表现突出,但在特定情境下仍表现出持续性偏见。这些发现凸显了确保模型行为公平的持续改进需求。
引用
@article{arxiv.2510.12857,
title = {Adaptive Generation of Bias-Eliciting Questions for LLMs},
author = {Robin Staab and Jasper Dekoninck and Maximilian Baader and Martin Vechev},
journal= {arXiv preprint arXiv:2510.12857},
year = {2025}
}