多模态仇恨言论分类——Hateful Memes 挑战赛的夺冠方案
计算与语言
2020-12-03 v1 机器学习
摘要
Hateful Memes 是一个用于多模态分类的新挑战数据集,聚焦于检测多模态表情包中的仇恨言论。数据集中加入了困难样本,使得仅依赖单模态信号难以奏效,这意味着只有多模态模型才能成功。据 Kiela 所述,在 Hateful Memes 上,当前最优方法的表现远逊于人类(准确率 64.73% 对 84.7%)。我提出了一种将多模态与规则相结合的新模型,分别以 86.8% 的准确率和 0.923 的 AUROC 取得排名第一。这些规则从训练集中提取,侧重于提升困难样本的分类准确率。
引用
@article{arxiv.2012.01002,
title = {Classification of Multimodal Hate Speech -- The Winning Solution of Hateful Memes Challenge},
author = {Xiayu Zhong},
journal= {arXiv preprint arXiv:2012.01002},
year = {2020}
}