中文

利用自然语言处理揭示跨国内容审核的隐藏机制

计算与语言 2025-03-11 v2

摘要

自然语言处理 (NLP) 方法将文本分类到多个类别的能力,促使了它们在仇恨言论和假新闻检测等在线内容审核任务中的应用。然而,对于这些方法如何或为何做出此类决策,或者为何某些内容一开始就会被审核,人们的理解仍然有限。为了研究内容审核背后的隐藏机制,我们探索了多个方向:1) 训练分类器以逆向工程跨国内容审核决策;2) 通过分析 Shapley 值和 LLM 引导的解释来解释内容审核决策。我们的主要焦点是使用从 Twitter Stream Grab 采样的现有语料库,研究跨国内容审核决策。我们的实验揭示了被审查帖子在不同国家和时间上的有趣模式。通过对三种 LLM 生成的解释进行人工评估,我们评估了在内容审核中使用 LLM 的有效性。最后,我们讨论了潜在的未来方向,以及本工作的局限性和伦理考量。我们的代码和数据可在 https://github.com/causalNLP/censorship 获取

关键词

引用

@article{arxiv.2503.05280,
  title  = {Revealing Hidden Mechanisms of Cross-Country Content Moderation with Natural Language Processing},
  author = {Neemesh Yadav and Jiarui Liu and Francesco Ortu and Roya Ensafi and Zhijing Jin and Rada Mihalcea},
  journal= {arXiv preprint arXiv:2503.05280},
  year   = {2025}
}