不同评分者群体在多模态安全感知中分歧模式的洞察
人工智能
2024-10-23 v1
摘要
人工智能系统严重依赖人类评分,但这些评分通常被聚合,掩盖了现实世界现象中固有的观点多样性。这在评估生成式AI的安全性时尤其令人担忧,因为感知和相关危害可能因社会文化背景而有显著差异。虽然最近的研究探讨了人口统计学差异对文本标注的影响,但对于这些主观变化如何影响生成式AI中的多模态安全性,我们了解有限。为解决此问题,我们进行了一项大规模研究,使用了来自630名评分者(按年龄、性别和种族在30个交叉群体中平衡)对约1000个文本到图像(T2I)生成结果的高度并行安全评分。我们的研究表明:(1)不同人口统计群体(包括交叉群体)在评估危害严重程度方面存在显著差异,并且这些差异因不同类型的安全违规而异;(2)多样化的评分者群体捕捉到的标注模式与经过特定安全策略培训的专家评分者存在实质性差异;(3)我们在T2I安全性中观察到的差异与先前记录的基于文本的安全任务中的群体层面差异不同。为进一步理解这些不同的视角,我们对评分者提供的开放式解释进行了定性分析。该分析揭示了不同群体在T2I生成结果中感知危害的原因的核心差异。我们的发现强调了将多样化视角纳入生成式AI安全性评估的迫切需要,以确保这些系统真正具有包容性并反映所有用户的价值观。
引用
@article{arxiv.2410.17032,
title = {Insights on Disagreement Patterns in Multimodal Safety Perception across Diverse Rater Groups},
author = {Charvi Rastogi and Tian Huey Teh and Pushkar Mishra and Roma Patel and Zoe Ashwood and Aida Mostafazadeh Davani and Mark Diaz and Michela Paganini and Alicia Parrish and Ding Wang and Vinodkumar Prabhakaran and Lora Aroyo and Verena Rieser},
journal= {arXiv preprint arXiv:2410.17032},
year = {2024}
}
备注
20 pages, 7 figures