探究大型生成模型之间关联性偏见
计算机与社会
2026-01-30 v1 人工智能
摘要
生成式 AI 中的社会偏见不仅体现为性能差异,还体现为关联性偏见,即模型学习并再现概念与人口统计群体之间的刻板印象关联,即使在没有明确人口统计信息的情况下(例如,将医生与男性关联)。这些关联可能在模型间通信管道中反复交换中持续传播,甚至放大,其中一个生成模型的输出成为另一个模型的输入。这在以人为中心的感知任务中尤为突出,例如人类活动识别和情感预测,其中对行为和内部状态的推断可能导致错误或刻板印象关联,进而导致不平等的对待。在本研究中,我们聚焦于人类活动和情感表达,研究这些关联在交替进行的图像生成和图像描述的模型间通信管道中如何演化。我们使用 RAF-DB 和 PHASE 数据集量化由模型间信息交换引起的人口统计分布漂移,并评估这些漂移是否具有系统性。我们的结果显示,双方的动作和情感都呈现出向更年轻表征的趋势,情感方面还呈现出更偏向女性表征的趋势。我们进一步发现,一些预测是由不相关的视觉区域(例如背景或发型)而非概念相关线索(例如身体或面部)支持的。我们也检查了这些人口统计漂移是否转化为下游行为的可测差异,即在预测活动和情感标签时。最后,我们概述了跨数据、训练和部署干预的缓解策略,并强调在部署 interconnected 模型于以人为中心的 AI 系统时需要谨慎的保障措施。
引用
@article{arxiv.2601.22093,
title = {Investigating Associational Biases in Inter-Model Communication of Large Generative Models},
author = {Fethiye Irmak Dogan and Yuval Weiss and Kajal Patel and Jiaee Cheong and Hatice Gunes},
journal= {arXiv preprint arXiv:2601.22093},
year = {2026}
}