中文

推特上仇恨言论的执法与可行性

计算机与社会 2026-04-15 v1 计算与语言

摘要

在线仇恨言论与重大的社会危害相关,但仍不清楚平台如何一致地执行仇恨言论政策,或执法在规模上是否可行。我们通过对推特(现为X)仇恨言论执法的全球审计来回答这些问题。使用完整的24小时公开推文快照,我们构建了由在八个主要语言中受训注释员进行注释的54万条推文代表性样本。五个月后,80%的仇恨推文仍在线,包括明确暴力仇恨言论。此类推文不比非仇恨推文更容易被删除,删除的严重程度或可见性都不会增加其被删除的可能性。我们随后检验这些执法缺口是否反映大规模监管系统的技术限制。虽然完全自动的检测系统无法可靠地识别仇恨言论而不产生大量误报,但它们能有效地优先安排可能违反规定的推文进行人工审查。模拟人机混合监管流程表明,在现有监管罚金成本之下,显著降低用户暴露于仇恨言论是经济可行的。这些结果表明,线上仇恨的持续存在不能仅由技术限制来解释,还反映了在监管资源分配方面的制度性选择。

关键词

引用

@article{arxiv.2604.12289,
  title  = {The Enforcement and Feasibility of Hate Speech Moderation on Twitter},
  author = {Manuel Tonneau and Dylan Thurgood and Diyi Liu and Niyati Malhotra and Victor Orozco-Olvera and Ralph Schroeder and Scott A. Hale and Manoel Horta Ribeiro and Paul Röttger and Samuel P. Fraiberger},
  journal= {arXiv preprint arXiv:2604.12289},
  year   = {2026}
}