中文

FairMonitor:用于检测大语言模型中刻板印象和偏见的双框架系统

计算与语言 2024-05-07 v1

摘要

检测大语言模型 (LLM) 中的刻板印象和偏见对于增强公平性、减少这些模型在应用中对个体或群体的不利影响至关重要。传统方法依赖嵌入空间或基于概率指标,难以揭示不同情境中存在的细微和隐式偏见。为此,我们提出 FairMonitor 框架,采用静态-动态检测方法对 LLM 中的刻板印象和偏见进行全面评估。静态组件包括直接询问测试、隐式联想测试和未知情境测试,其中包括 10,262 个开放式问题,涉及 9 个敏感因素和 26 个教育情境。该方法能够有效评估显式和隐式偏见。此外,我们利用多主体系统构建动态情境,以检测更复杂和真实环境中的细微偏见。该组件基于 LLM 在 600 种多样化教育情境中的交互行为进行偏见检测。实验结果表明,静态和动态方法的协同作用能够更全面地检测到 LLM 中的刻板印象和偏见。

关键词

引用

@article{arxiv.2405.03098,
  title  = {FairMonitor: A Dual-framework for Detecting Stereotypes and Biases in Large Language Models},
  author = {Yanhong Bai and Jiabao Zhao and Jinxin Shi and Zhentao Xie and Xingjiao Wu and Liang He},
  journal= {arXiv preprint arXiv:2405.03098},
  year   = {2024}
}