HatePRISM: 政策、平台与研究的集成。 advancing NLP for Hate Speech Proactive Mitigation
计算与语言
2025-07-08 v1
摘要
尽管各国及社交媒体平台(如印度政府,2021;欧洲议会与欧盟理事会,2022)等实施了规定,仇恨内容仍然是重大挑战。现有方法主要依赖阻塞或暂停 offensive 信息等反应性措施,新兴策略聚焦于detoxification和counterspeech等主动措施。本工作称为 HatePRISM,我们从三个角度全面审视了仇恨言论的规定与策略:国家规定、社交平台政策以及 NLP 研究数据集。我们的发现表明,仇恨言论定义与 moderation 实践在不同司法管辖区和平台之间存在显著不一致,同时缺乏与研究工作的一致性。基于这些洞察,我们提出想法和研究方向,以实现集成化的自动化仇恨言论 moderation 框架,纳入多样化策略。
引用
@article{arxiv.2507.04350,
title = {HatePRISM: Policies, Platforms, and Research Integration. Advancing NLP for Hate Speech Proactive Mitigation},
author = {Naquee Rizwan and Seid Muhie Yimam and Daryna Dementieva and Florian Skupin and Tim Fischer and Daniil Moskovskiy and Aarushi Ajay Borkar and Robert Geislinger and Punyajoy Saha and Sarthak Roy and Martin Semmann and Alexander Panchenko and Chris Biemann and Animesh Mukherjee},
journal= {arXiv preprint arXiv:2507.04350},
year = {2025}
}
备注
arXiv admin note: substantial text overlap with arXiv:2406.19543