SWE2:面向仇恨言论检测的子词丰富与重要词强调框架
计算与语言
2024-09-26 v1 机器学习
摘要
在线社交网络上的仇恨言论检测已成为近年来的新兴热点之一。由于在线社交网络上传播广泛且传播速度快,仇恨言论通过增加偏见和伤害他人对社会产生重大影响。因此,这引起了工业界和学术界的关注与担忧。在本文中,我们探讨仇恨言论问题,并提出了一种名为 SWE2 的新型仇恨言论检测框架,该框架仅依赖消息内容并自动识别仇恨言论。具体而言,我们的框架同时利用词级语义信息和子词知识。这在直观上具有说服力,并且在存在/不存在字符级对抗攻击的情况下均表现良好。实验结果表明,我们提出的模型实现了 0.975 的准确率和 0.953 的宏 F1,在无对抗攻击下优于 7 个最先进的基线。我们的模型在极端对抗攻击(50% 消息被篡改)下稳健且显著地表现良好,实现了 0.967 的准确率和 0.934 的宏 F1。
引用
@article{arxiv.2409.16673,
title = {SWE2: SubWord Enriched and Significant Word Emphasized Framework for Hate Speech Detection},
author = {Guanyi Mou and Pengyi Ye and Kyumin Lee},
journal= {arXiv preprint arXiv:2409.16673},
year = {2024}
}
备注
Published in CIKM 2020