大语言模型中的性别与内容偏见:以 Google Gemini 2.0 Flash Experimental 为案例研究
计算与语言
2025-03-24 v1 人工智能
计算机与社会
人机交互
摘要
本研究评估了由 Google Develop 的最新大语言模型(Large Language Model,LLM)Gemini 2.0 Flash Experimental 中的偏见,具体聚焦内容 moderation 和性别差异。通过将其性能与作者前一工作中检验的 ChatGPT-4o 进行比较,分析凸显了其在伦理 moderation 实践方面的一些差异。Gemini 2.0 显示出降低的性别偏见,尤其是 female-specific 提示在接受率方面显著提升,与通过 ChatGPT-4o 获取的结果相比。这一模型对性内容采取更宽容的立场,并对包括性别特定案例在内的暴力提示保持相对较高的接受率。尽管如此,这些变化是否构成改进仍值得争议。尽管在某些偏见方面取得了减少,但这以允许更多针对男性和女性的暴力内容为代价,可能正规化暴力而非减轻伤害。男性-specific 提示仍通常获得更高的接受率。这些发现凸显了将 AI 系统与伦理标准对齐的复杂性,突出了在减少某些偏见方面的进展,同时对该模型更宽容的做法引发担忧。持续的细化对于实现确保透明度、公平性和包容性而不放大有害内容的 moderation 实践至关重要。
引用
@article{arxiv.2503.16534,
title = {Gender and content bias in Large Language Models: a case study on Google Gemini 2.0 Flash Experimental},
author = {Roberto Balestri},
journal= {arXiv preprint arXiv:2503.16534},
year = {2025}
}