中文

评估 LLM 中的性别偏见:将 LLM 输出与人类感知及官方统计数据进行比较

计算与语言 2024-11-22 v1 机器学习

摘要

本研究通过将大语言模型 (LLM) 的性别感知与人类受访者、美国劳工统计局数据以及 50% 无偏见基准进行比较,调查了 LLM 中的性别偏见。我们利用职业数据和角色特定句子创建了一个新的评估集。与包含在 LLM 训练数据中的常见基准不同,我们的集合是新开发的,从而防止了数据泄露和测试集污染。我们测试了五个 LLM,要求其使用单词回答来预测每个角色的性别。我们使用 Kullback-Leibler (KL) 散度将模型输出与人类感知、统计数据以及 50% 中立性基准进行比较。所有 LLM 均显示出与性别中立的显著偏离,并与统计数据更为一致,但仍反映出固有的偏见。

关键词

引用

@article{arxiv.2411.13738,
  title  = {Assessing Gender Bias in LLMs: Comparing LLM Outputs with Human Perceptions and Official Statistics},
  author = {Tetiana Bas},
  journal= {arXiv preprint arXiv:2411.13738},
  year   = {2024}
}

备注

under review for Coling conference