中文

软件工程师是什么样的?探索 LLM 中的社会偏见

软件工程 2025-01-08 v1

摘要

大型语言模型(LLM)迅速流行起来,并被嵌入到专业应用中,由于其在生成类人内容方面的能力。然而,无条件依赖其输出和建议可能是有问题的,因为 LLM 可能强化社会偏见和刻板印象。本研究调查了大型语言模型,具体包括 OpenAI 的 GPT-4 和 Microsoft Copilot,如何通过文本和图形输出在软件工程(SE)职业中强化性别和种族刻板印象。我们让每个 LLM 为招聘情境中的 300 个轮廓生成建议,其中包括 100 个基于性别的轮廓和 50 个性别中性轮廓。针对每个轮廓生成建议并根据四个不同 SE 职位的职位要求进行评估。每个 LLM 被要求为每个职位选择前 5 个候选人,然后选择最佳候选人。每个 LLM 还被要求为前 5 个候选人生成图像,为分析文本化选择和视觉表示中的潜在偏见提供数据集。我们的分析显示,两个模型都偏好男性和 Caucasian 轮廓,特别是对于高级职位,偏好显示出更浅的肤色、更瘦的体型和更年轻的外貌特征。这些发现表明,社会偏见影响了 LLM 的输出,导致狭窄的、排斥性的刻板印象,进一步限制了多样性并加剧了不平等。在 LLM 越来越多地被采纳用于 SE 研究和专业实践时,意识到这些偏见至关重要,以防止歧视规范的强化,并确保 AI 工具被用于促进包容性和平等的工程文化而非阻碍其中。

关键词

引用

@article{arxiv.2501.03569,
  title  = {What Does a Software Engineer Look Like? Exploring Societal Stereotypes in LLMs},
  author = {Muneera Bano and Hashini Gunatilake and Rashina Hoda},
  journal= {arXiv preprint arXiv:2501.03569},
  year   = {2025}
}

备注

Accepted for publication in Software Engineering in Society (SEIS) in ICSE 2025