用于大规模检测文生图模型中隐性刻板印象的语言智能体
计算机与社会
2023-11-03 v3 计算与语言
摘要
近来扩散模型研究的激增加速了文生图模型在各人工智能生成内容(AIGC)商业产品中的采用。尽管这些卓越的 AIGC 产品正获得越来越多认可并激发消费者热情,关于这些模型是否、何时及如何无意中强化既有社会刻板印象的问题仍基本未被探讨。受语言智能体近期进展启发,我们在此引入一种专为文生图模型刻板印象检测设计的新型智能体架构。该通用智能体架构可容纳自由形式的检测任务,并能自主调用多种工具以推进从生成相应指令与图像到检测刻板印象的整个过程。我们基于多个开放文本数据集构建刻板印象相关基准,并将该架构应用于商业产品与流行的开源文生图模型。我们发现,这些模型在涉及个人特征、社会文化背景及犯罪相关方面的某些提示时,常表现出严重刻板印象。总之,这些实证发现凸显了跨越性别、种族与宗教等社会维度的刻板印象普遍存在的现象,这不仅验证了我们所提方法的有效性,也强调了在蓬勃发展的 AIGC 领域应对潜在伦理风险的紧要性。随着 AIGC 持续快速扩张,新模型与插件以惊人数量每日涌现,挑战在于及时检测并缓解这些模型中的潜在偏差。
引用
@article{arxiv.2310.11778,
title = {Language Agents for Detecting Implicit Stereotypes in Text-to-image Models at Scale},
author = {Qichao Wang and Tian Bian and Yian Yin and Tingyang Xu and Hong Cheng and Helen M. Meng and Zibin Zheng and Liang Chen and Bingzhe Wu},
journal= {arXiv preprint arXiv:2310.11778},
year = {2023}
}