一种可解释的仇恨表情包检测方法
机器学习
2021-08-24 v1 计算与语言
摘要
仇恨表情包是一种新兴的互联网仇恨传播方式,依赖图像和文本共同传达仇恨信息。我们采用可解释的方法进行仇恨表情包检测,使用机器学习和简单启发式规则来识别将表情包分类为仇恨的最关键特征。在此过程中,我们构建了梯度提升决策树和基于 LSTM 的模型,在该具有挑战性的任务上取得了与人类金标准以及最先进 transformer 模型相当的 performance(验证集 auROC 73.8,测试集 auROC 72.7)。
引用
@article{arxiv.2108.10069,
title = {An Interpretable Approach to Hateful Meme Detection},
author = {Tanvi Deshpande and Nitya Mani},
journal= {arXiv preprint arXiv:2108.10069},
year = {2021}
}
备注
5 pages. 2021 ACM International Conference on Multimodal Interaction (ICMI)