Attentive Fusion:一种基于 Transformer 的多模态仇恨言论检测方法
计算与语言
2024-01-22 v1 机器学习
声音
音频与语音处理
信号处理
摘要
随着近期社交媒体使用的激增和指数级增长,审查社交媒体内容中是否存在仇恨内容至关重要。过去十年来,研究人员一直致力于区分宣扬仇恨的内容与不宣扬仇恨的内容。传统上,主要重点在于分析文本内容。然而,最近的研究尝试也已开始涉及基于音频内容的识别。尽管如此,研究表明仅依赖音频或文本内容可能效果不佳,因为最近的激增表明人们经常在言语和写作中使用讽刺。为了克服这些挑战,我们提出了一种利用音频和文本表示来识别言论是否宣扬仇恨的方法。我们的方法基于 Transformer 框架,该框架结合了音频和文本采样,并配有我们自己的名为“Attentive Fusion”的层。我们的研究结果超越了以前的 SOTA 技术,在测试集上取得了 0.927 的优异宏 F1 分数。
引用
@article{arxiv.2401.10653,
title = {Attentive Fusion: A Transformer-based Approach to Multimodal Hate Speech Detection},
author = {Atanu Mandal and Gargi Roy and Amit Barman and Indranil Dutta and Sudip Kumar Naskar},
journal= {arXiv preprint arXiv:2401.10653},
year = {2024}
}
备注
Accepted in 20th International Conference on Natural Language Processing (ICON)