中文

失踪的审查:商业内容审查 API 在群体定向仇恨言论和语言变体上的过度与不足审查

人机交互 2025-03-04 v1 计算与语言

摘要

商业内容审查 API 被 marketed as 规模化解决方案,以遏制网络仇恨言论。然而,这些 API 的依赖风险既可能导致合法言论被静音(称为过度审查),也可能使平台未能有效防范有害言论(称为不足审查)。为评估此类风险,本文引入了一个用于审计黑盒 NLP 系统的框架。我们运用该框架系统性地评估了五个广泛使用的商业内容审查 API。基于四个数据集分析五百万查询,我们发现 API 经常依赖群体身份术语(如 "black")来预测仇恨言论。尽管 OpenAI 和 Amazon 的服务稍微表现更好,但所有提供商都不足以审查隐性仇恨言论,尤其是针对 LGBTQIA+ 群体的暗示性信息。同时,这些 API 也会过度审查反言论、已抢救过的辱骂词以及与 Black、LGBTQIA+、Jewish 和 Muslim 群体相关的内容。我们建议 API 提供商在 API 实现和阈值设置方面提供更好的指导,并对其 API 局限性提供更多透明度。警告:本文包含冒犯性和仇恨性术语和概念。我们选择复制这些术语是出于透明度的考虑。

关键词

引用

@article{arxiv.2503.01623,
  title  = {Lost in Moderation: How Commercial Content Moderation APIs Over- and Under-Moderate Group-Targeted Hate Speech and Linguistic Variations},
  author = {David Hartmann and Amin Oueslati and Dimitri Staufer and Lena Pohlmann and Simon Munzert and Hendrik Heuer},
  journal= {arXiv preprint arXiv:2503.01623},
  year   = {2025}
}

备注

This is the author's version of the paper accepted at CHI Conference on Human Factors in Computing Systems (CHI '25), April 26-May 1, 2025, Yokohama, Japan