“我无法写这个,因为它违反了我们的内容政策”:理解生成式AI产品中的内容审核策略与用户体验
人机交互
2025-06-18 v1
摘要
尽管最近的研究集中在为生成式AI(GAI)模型层面的内容安全开发防护措施,但关于在真实世界的GAI产品中,为防止恶意内容而进行的内容审核如何为最终用户发挥作用,我们知之甚少。为弥补这一差距,我们调查了GAI在线工具(面向消费者的基于网络的GAI应用)中的内容审核策略及其执行情况。我们首先分析了14个GAI在线工具的内容审核策略。虽然这些策略在概述审核实践方面很全面,但它们通常缺乏关于实际实施的细节,并且没有具体说明用户如何协助审核或对审核决定提出申诉。接下来,我们通过Reddit上关于GAI在线工具的讨论,考察了用户经历的内容审核成功与失败。我们发现,尽管审核系统普遍成功地阻止了恶意生成,但用户在审核系统和审核后用户支持的双重失败中频繁感到沮丧。基于这些发现,我们为真实世界GAI产品中的内容审核策略和用户体验提出了改进建议。
引用
@article{arxiv.2506.14018,
title = {"I Cannot Write This Because It Violates Our Content Policy": Understanding Content Moderation Policies and User Experiences in Generative AI Products},
author = {Lan Gao and Oscar Chen and Rachel Lee and Nick Feamster and Chenhao Tan and Marshini Chetty},
journal= {arXiv preprint arXiv:2506.14018},
year = {2025}
}
备注
Preprint for USENIX Security 2025