中文

面向开放式 LLM 生成的偏见关联发现框架

计算与语言 2026-01-21 v2

摘要

大语言模型(LLM)中嵌入的社会偏见引发了关键关切,表现为表征性伤害——即对人口统计学群体进行不公平或扭曲的描绘,这些扭曲可能以微妙方式通过生成的语言表达出来。现有的评估方法往往依赖于预定义的身份-概念关联,限制了其捕捉新颖或意外偏见形式的能力。本文提出了偏见关联发现框架(BADF),该框架系统性地从开放式 LLM 输出中提取已知和尚未识别的身份与描述性概念之间的关联。通过覆盖多个模型和多样化真实世界情境的全面实验,BADF 能够对 characterize 人口统计学身份的各种概念进行稳健的映射和分析。我们的发现推进了对开放式生成中偏见的理解,并提供了一个可扩展的工具,用于识别和分析 LLM 中的偏见关联。

关键词

引用

@article{arxiv.2508.01412,
  title  = {Bias Association Discovery Framework for Open-Ended LLM Generations},
  author = {Jinhao Pan and Chahat Raj and Ziwei Zhu},
  journal= {arXiv preprint arXiv:2508.01412},
  year   = {2026}
}

备注

AAAI 2026