“仅是奇怪的图片”:从多元标注者视角评估生成式AI图像安全标注任务
人机交互
2025-07-23 v1 人工智能
摘要
理解AI生成内容的安全性界定是复杂的。虽然开发者常依赖预定义的分类体系,但现实中的安全判断也涉及个人、社会和文化层面的伤害感知。本文考察了标注者如何评估AI生成图像的安全性,聚焦于其判断背后的定性理由。分析5372条开放性评论,我们发现标注者持续引用道德、情感和情境理性,超越结构化的安全类别。许多人反思对他人的潜在伤害,而非自身,依据生活经验、集体风险和社会文化意识。超越个人感知,我们还发现任务本身的结构——包括标注指南——塑造了标注者如何解释和表达伤害。指南不仅影响哪些图像被标记,也影响其正当化背后的道德判断。标注者经常引用图像质量、视觉失真以及提示与输出不匹配等因素作为感知伤害维度的贡献因素,这些因素在标准评估框架中常被忽视。我们的发现揭示了现有安全管道缺失了标注者所带来的关键性理性。我们主张在评估设计中搭建道德反思、区分伤害类型,并为AI生成内容的主观、情境敏感解释留出空间。
引用
@article{arxiv.2507.16033,
title = {"Just a strange pic": Evaluating 'safety' in GenAI Image safety annotation tasks from diverse annotators' perspectives},
author = {Ding Wang and Mark Díaz and Charvi Rastogi and Aida Davani and Vinodkumar Prabhakaran and Pushkar Mishra and Roma Patel and Alicia Parrish and Zoe Ashwood and Michela Paganini and Tian Huey Teh and Verena Rieser and Lora Aroyo},
journal= {arXiv preprint arXiv:2507.16033},
year = {2025}
}
备注
Accepted to AAAI/ACM Conference on Artificial Intelligence, Ethics, and Society 2025 (AIES 2025)