中文

解码偏见:面向性别偏见检测的自动化方法与LLM评判

计算与语言 2024-08-08 v1 人工智能

摘要

大型语言模型(LLM)在语言理解和生成人类水平文本方面表现卓越。然而,即便经过监督训练和人类对齐,这些LLM仍容易受到对抗性攻击,恶意用户可诱导模型生成不可取文本。LLM本身也会编码潜在偏见,可能在交互中引发各种有害影响。偏见评估指标缺乏标准和共识,现有方法常依赖人工生成的模板和标注,成本高昂且耗时。本文训练模型自动创建对抗性提示,以诱发目标LLM生成偏见性响应。我们提出LLM-based偏见评估指标,并分析了多种现有自动评估方法。我们分析了模型响应的细微差异,识别了不同模型家族的优势与不足,评估了评估方法的不足之处。我们将这些指标与人类评估进行比较,验证LLM-as-a-Judge指标在响应生成偏见方面与人类判断一致。

关键词

引用

@article{arxiv.2408.03907,
  title  = {Decoding Biases: Automated Methods and LLM Judges for Gender Bias Detection in Language Models},
  author = {Shachi H Kumar and Saurav Sahay and Sahisnu Mazumder and Eda Okur and Ramesh Manuvinakurike and Nicole Beckage and Hsuan Su and Hung-yi Lee and Lama Nachman},
  journal= {arXiv preprint arXiv:2408.03907},
  year   = {2024}
}

备注

6 pages paper content, 17 pages of appendix