中文

生成式 AI 内容审核中的身份相关语音抑制

计算与语言 2025-07-25 v3 计算机与社会 人机交互

摘要

自动内容审核长期用于帮助识别和过滤线上用户生成的内容。但该系统历史上常常错误地标记涉及或来自边缘群体的内容进行删除。生成式 AI 系统现在使用此类过滤器,以防止不当生成内容被创建或显示给用户。虽然很大程度上关注确保此类系统不会产生不当结果,但关于确保能够生成适当文本的注意力相对较少。从课堂到好莱坞,随着生成式 AI 在创意或表达性文本生成中日益普及,这些技术将允许讲述哪些故事,抑制哪些声音?本文定义并引入语音抑制的度量,聚焦于不同身份群体相关的语音被各种内容审核 API 错误过滤的情形。我们利用包括传统内容审核中使用的短式用户生成数据集以及更长的生成式 AI 专用数据集(包括本文引入的两个数据集),为九个身份群体创建了语音抑制基准。在测试的九个自动内容审核服务中,我们发现与其他语音相比,身份相关语音更可能被错误抑制。我们发现,错误标记行为的原因因身份而异,源于刻板印象和文本关联,例如,与残障相关的内容更可能因自伤或健康原因被标记为不当,而非基督徒内容则更可能被标记为暴力或仇恨。随着生成式 AI 系统在创意工作中日益广泛使用,我们呼吁进一步关注这一问题对身份相关内容创建的潜在影响。

关键词

引用

@article{arxiv.2409.13725,
  title  = {Identity-related Speech Suppression in Generative AI Content Moderation},
  author = {Grace Proebsting and Oghenefejiro Isaacs Anigboro and Charlie M. Crawford and Danaé Metaxa and Sorelle A. Friedler},
  journal= {arXiv preprint arXiv:2409.13725},
  year   = {2025}
}

备注

ACM Conference on Equity and Access in Algorithms, Mechanisms, and Optimization, 2025