单智能体与多智能体生成式 AI 架构中的语言偏见分析
人工智能
2026-03-20 v1
摘要
文献中许多工作表明,大语言模型(LLM)的输出表现出歧视性行为,基于输入所使用的方言进行刻板印象推断。这一偏见在相同输入分别提供给标准美式英语(AAE)和非裔美式英语(AAE)时尤为突出。本文复制现有对方言敏感刻板印象生成的分析,并调查缓解策略的效果,包括提示工程(角色基和链式思考提示)以及由生成-批判-修订模型组成的多智能体架构。我们定义八个提示模板来分析方言偏见的不同表现方式,例如针对 SAE 或 AAE 说话者的建议姓名、职业和形容词。我们采用 LLM 作为评判员来评估结果中的偏见。我们的结果显示,在所有模板类别中,AAE 相关输出与 SAE 相关输出之间都存在刻板印象差异,其中形容词和职业归属效应最为显著。基线差异因模型而异,Claude Haiku 中 SAE-AAE 差异最大,Phi-4 Mini 中最小。链式思考提示对 Claude Haiku 有效缓解偏见,而多智能体架构确保所有模型都能获得一致缓解。这些发现表明,针对交叉性感知软件工程,公平性评估应包括模型特定的缓解策略验证,以及高风险 LLM 部署中的工作流程级控制(例如涉及批判模型的智能体架构)。当前结果为探索性研究,范围有限,但可通过增加数据集规模并将程序应用于不同语言或方言来进行扩展和复制。
引用
@article{arxiv.2603.18729,
title = {Analysis Of Linguistic Stereotypes in Single and Multi-Agent Generative AI Architectures},
author = {Martina Ullasci and Marco Rondina and Riccardo Coppola and Flavio Giobergia and Riccardo Bellanca and Gabriele Mancari Pasi and Luca Prato and Federico Spinoso and Silvia Tagliente},
journal= {arXiv preprint arXiv:2603.18729},
year = {2026}
}