中文

通过模型解释缓解AI生成故事中的性别与种族偏见

计算与语言 2025-09-08 v1 人工智能

摘要

已有研究表明,语言模型会通过其输出传播社会偏见,尤其是在性别和种族的表征方面。本文研究了AI生成的职业故事中的性别与种族偏见。在应用我们提出的缓解策略——基于解释的偏见分析与缓解(BAME)前后,我们测量了表征偏见,结果显示人口统计学表征改善了2%至20%。BAME利用模型生成的解释来指导针对性的提示工程,在不修改模型参数的情况下有效减少了偏见。通过分析25个职业组、三个大型语言模型(Claude 3.5 Sonnet、Llama 3.1 70B Instruct和GPT-4 Turbo)以及多个人口统计学维度的生成故事,我们发现了与训练数据刻板印象相关的代表性过高和代表性不足的持续模式。我们的研究结果表明,利用模型自身的内部推理机制来引导模型可以显著增强人口统计学平等性,从而有助于开发更透明的生成式AI系统。

关键词

引用

@article{arxiv.2509.04515,
  title  = {Mitigation of Gender and Ethnicity Bias in AI-Generated Stories through Model Explanations},
  author = {Martha O. Dimgba and Sharon Oba and Ameeta Agrawal and Philippe J. Giabbanelli},
  journal= {arXiv preprint arXiv:2509.04515},
  year   = {2025}
}