大型语言模型中的决策偏见:关于关系冲突的研究
计算与语言
2024-10-16 v1
摘要
大型语言模型(LLM)从训练数据中获取关于性别的信念,因此可能生成带有刻板性性别态度的文本。先前的研究表明模型生成偏好某一性别或呈现性别刻板印象,但尚未探讨影响模型推理和涉及性别的决策-making 复杂动态。我们通过一个新数据集 DeMET Prompts 研究 LLM 中的性别平等,该数据集包含与密切、浪漫关系相关的情景。我们通过三个姓名列表(男性、女性、中性)中的九种关系配置进行探索。我们通过诸多视角考察性别角色中的公平性:常规与性别中性姓名、是否包含模型安全增强、相同性别与混合性别关系、以及在各种主题下平等与传统情景。尽管所有模型都呈现相同的偏见(女性优先,其次是性别中性姓名,最后是男性),但安全防护措施会降低偏见。此外,模型倾向于规避传统的男性主导刻板印象,更多地支持“传统上女性”个体,表明模型将关系视为女性领域。
引用
@article{arxiv.2410.11084,
title = {Gender Bias in Decision-Making with Large Language Models: A Study of Relationship Conflicts},
author = {Sharon Levy and William D. Adler and Tahilin Sanchez Karver and Mark Dredze and Michelle R. Kaufman},
journal= {arXiv preprint arXiv:2410.11084},
year = {2024}
}
备注
EMNLP Findings 2024