中文

大型语言模型评估:STEM教育与性别刻板印象

计算与语言 2024-06-17 v1 人工智能

摘要

大型语言模型(LLMs)对我们的日常生活产生越来越大的影响,应用场景包括聊天机器人、学习支持、编码支持、构思、写作辅助等。先前的研究揭示了LLMs中关于职业所使用的代词以及关于男性与女性所使用的形容词的语言偏见。尽管已在更新版LLM中至少解决了一些问题,以通过现有测试,但偏见可能仍然存在,反复使用性别刻板印象语言可能强化其底层假设,因此有必要进一步检查。本文通过开放式、贴近实际的用户案例实验设计和定量分析,探讨LLMs中与教育选择相关的性别偏见。我们在四个不同文化、语言和教育体系(英语/美国/英国、丹麦/DK、巴斯克毗地/ES和印度/IN)中进行研究,年龄范围为10至16岁,对应不同国家的重要教育转折点。我们发现,针对典型女孩和男孩姓名所提供的STEM与非STEM教育路径建议比例存在显著且大的差异。在丹麦、西班牙和印度语境中,通常比英语语境中提供的STEM建议更少。我们也发现所建议职业存在细微差异,我们对其进行分类并报告。

关键词

引用

@article{arxiv.2406.10133,
  title  = {Evaluation of Large Language Models: STEM education and Gender Stereotypes},
  author = {Smilla Due and Sneha Das and Marianne Andersen and Berta Plandolit López and Sniff Andersen Nexø and Line Clemmensen},
  journal= {arXiv preprint arXiv:2406.10133},
  year   = {2024}
}