中文

云端内容审查服务的公平性审计比较研究

计算机与社会 2024-06-21 v1 计算与语言 人机交互 机器学习

摘要

在线平台面临着不断增加的内容审查挑战,包括有害仇恨言论。由于缺乏明确的法律定义以及对算法在内容审查决策中作用的透明度不足,迫切需要外部问责。在本研究中,我们通过第三方审计系统地评估了四家领先的云端内容审查服务,强调了可能因过度依赖这些服务而引发对少数族裔和脆弱群体的偏见问题。我们采用黑箱审计方法和四个基准数据集,测量其在显性和隐式仇恨言论检测方面的性能,以及通过扰动敏感性分析进行的反事实公平性。我们的分析显示,所有服务在检测隐式仇恨言论方面都存在困难,这种言论依赖更细微和编码化的消息。此外,我们的结果表明,需要消除群体特定的偏见。似乎对某些群体(如女性)的偏见已大多被纠正,但对其他群体(如 LGBTQ+ 和 PoC)的偏见仍然存在。

关键词

引用

@article{arxiv.2406.14154,
  title  = {Watching the Watchers: A Comparative Fairness Audit of Cloud-based Content Moderation Services},
  author = {David Hartmann and Amin Oueslati and Dimitri Staufer},
  journal= {arXiv preprint arXiv:2406.14154},
  year   = {2024}
}

备注

Accepted at European Workshop on Algorithmic Fairness (EWAF'24)