中文

评估 LLM 开放式生成偏置基准中的指标模型偏置

计算与语言 2025-01-22 v1 人工智能

摘要

开放式生成偏置基准通过分析大语言模型(LLM)的输出来评估其中的社会偏见。然而,分析中使用的分类器往往本身存在偏见,导致得出不公平的结论。本研究 examines 了此类偏见,具体包括 BOLD 和 SAGED 等开放式生成基准。我们使用 MGSD 数据集进行了两项实验。第一项使用反事实样本来测量不同人口统计学群体在改变刻板印象相关前缀后的预测差异;第二项应用可解释性工具(如 SHAP)来验证所观察到的偏见确实来源于这些反事实样本。结果揭示了对人口统计学描述符的处理不均,呼吁构建更稳健的偏见指标模型。

关键词

引用

@article{arxiv.2410.11059,
  title  = {Assessing Bias in Metric Models for LLM Open-Ended Generation Bias Benchmarks},
  author = {Nathaniel Demchak and Xin Guan and Zekun Wu and Ziyi Xu and Adriano Koshiyama and Emre Kazim},
  journal= {arXiv preprint arXiv:2410.11059},
  year   = {2025}
}

备注

NeurIPS 2024 EvalEval Workshop