中文

通过输出中的语言变异识别GPT模型中意识形态偏见的来源

计算与语言 2024-09-11 v1

摘要

现有研究表明,GPT-3.5和GPT-4等生成式AI模型会延续社会刻板印象和偏见。一个令人担忧但探索较少的偏见来源是意识形态。GPT模型是否在政治敏感话题上采取意识形态立场?在本文中,我们提供了一种识别生成模型中意识形态偏见的原创方法,表明偏见可能源于训练数据和过滤算法。我们利用具有对比性政治态度的国家中的语言变异,评估了GPT对这些语言中敏感政治话题的平均回答中的偏见。首先,我们发现GPT的输出在映射到保守社会(如波兰语)的语言中更保守,而在自由社会(如瑞典语)中使用的语言中更自由。这一结果为GPT模型中的训练数据偏见提供了有力证据。其次,在GPT-3.5中观察到的跨语言差异在GPT-4中持续存在,尽管由于OpenAI的过滤政策,GPT-4明显更自由。我们的主要结论是,生成式模型训练必须专注于高质量、精心筛选的数据集以减少偏见,即使这意味着在训练数据规模上做出妥协。训练后过滤回应只会引入新的偏见,并不能消除底层的训练偏见。

引用

@article{arxiv.2409.06043,
  title  = {Identifying the sources of ideological bias in GPT models through linguistic variation in output},
  author = {Christina Walker and Joan C. Timoneda},
  journal= {arXiv preprint arXiv:2409.06043},
  year   = {2024}
}