中文

模型在无性别相关语言的文本中是否存在偏见?

计算与语言 2024-05-02 v1 人工智能 计算机视觉与模式识别 计算机与社会 机器学习

摘要

性别偏见研究在揭示大型语言模型中不良行为方面发挥了关键作用,暴露了与职业、情感等相关的严重性别刻板印象。在此之前的工作中,一个关键观察是,模型因训练数据中存在的性别相关相关性而强化刻板印象。在本文中,我们关注训练数据影响不明确的偏见情形,聚焦于问题:在非刻板化环境中,语言模型是否仍表现出性别偏见?为此,我们引入 UnStereoEval(USE),一个专为调查刻板化场景下性别偏见而设计的 novel 框架。USE 基于预训练数据统计信息定义了句子级得分,以确定句子是否包含最小的词语-性别关联。为系统性地评估流行语言模型在刻板化场景下的公平性,我们利用 USE 自动生成 benchmark,而无需任何性别相关语言。通过利用 USE 的句子级得分,我们也将先前的性别偏见 benchmark(Winobias 和 Winogender)用于非刻板化评估。令人惊讶的是,我们发现所有 28 个测试模型在公平性方面都表现不佳。具体而言,只有 9%~41% 的刻板化句子显示出公平行为,表明偏见并不仅源于性别相关词语的存在。这类结果提出了关于模型偏见根源的重要问题,并凸显了需要更系统、更全面的偏见评估的必要性。我们在 https://ucinlp.github.io/unstereo-eval 发布完整数据集和代码。

关键词

引用

@article{arxiv.2405.00588,
  title  = {Are Models Biased on Text without Gender-related Language?},
  author = {Catarina G Belém and Preethi Seshadri and Yasaman Razeghi and Sameer Singh},
  journal= {arXiv preprint arXiv:2405.00588},
  year   = {2024}
}

备注

In International Conference on Learning Representations 2024