在线讨论中仇恨、毒性与极端性的集体 moderation
计算机与社会
2025-11-24 v5
摘要
在数字时代,仇恨言论对社交媒体平台作为公共话语空间的功能构成威胁。自上而下 moderation 仇恨言论的方法因与表达自由冲突及可扩展性问题而面临困难。反言论(counter speech)作为一种由公民进行的集体 moderation 形式,已成为一种潜在补救手段。本文旨在研究哪些反言论策略最能有效降低在线平台上仇恨、毒性与极端性的盛行。我们分析德国 Twitter 上超过 130,000 条讨论,始于 2015 年移民危机高峰并延续四年。我们使用人工标注与机器学习分类器识别论证策略、内群体与外群体指涉、情绪基调及不同话语质量度量。通过匹配与时间序列分析,我们辨明自然观测到的反言论策略在微观(单条推文对)、中观(整个讨论)与宏观(跨日)层面的有效性。我们发现,表达直率意见——即便非事实但无侮辱——在所有分析层面均导致最少的后续仇恨、毒性与极端性。该策略补充了当前推荐的反言论策略,且公民易于参与。讽刺在改善话语质量方面亦有效,尤其在有组织极端群体存在时。超越多数既往研究中小样本的一次性分析,我们的发现对通过集体公民 moderation 成功管理公共在线空间具有启示。
引用
@article{arxiv.2303.00357,
title = {Collective moderation of hate, toxicity, and extremity in online discussions},
author = {Jana Lasser and Alina Herderich and Joshua Garland and Segun Taofeek Aroyehun and David Garcia and Mirta Galesic},
journal= {arXiv preprint arXiv:2303.00357},
year = {2025}
}