在线仇恨言论的演变:检测与缓解的自适应框架
计算与语言
2025-02-24 v2 社会与信息网络
摘要
社交媒体平台的普及导致仇恨言论的传播增加,尤其是针对弱势群体。不幸的是,现有的自动识别和屏蔽有毒语言的方法依赖于预先构建的词典,使其具有反应性而非自适应性。因此,这些方法随时间推移变得效果不佳,特别是当新社区受到原始数据集中未包含的辱骂性词汇攻击时。为了解决这一问题,我们提出了一种自适应方法,利用词嵌入来更新词典,并开发了一种混合模型,以适应新出现的辱骂性词汇和新的语言模式。该方法可以有效检测有毒语言,包括攻击者为规避检测而故意使用的拼写错误。我们的混合模型结合了 BERT 与基于词典的技术,在大多数最先进数据集上实现了 95% 的准确率。我们的工作对创建更安全的在线环境具有重大意义,通过改进有毒内容的检测并主动更新词典来实现。内容警告:本文包含可能引发不适的仇恨言论示例。
引用
@article{arxiv.2502.10921,
title = {Evolving Hate Speech Online: An Adaptive Framework for Detection and Mitigation},
author = {Shiza Ali and Jeremy Blackburn and Gianluca Stringhini},
journal= {arXiv preprint arXiv:2502.10921},
year = {2025}
}