中文

HateMM:用于仇恨视频分类的多模态数据集

计算机视觉与模式识别 2023-05-09 v1 计算与语言 多媒体

摘要

仇恨言论已成为现代社会最显著的问题之一,对线上与线下世界均有影响。因此,仇恨言论研究近期受到大量关注。然而,多数工作主要聚焦于文本媒体,涉及图像的研究相对较少,针对视频的则更少。因此,需要早期的自动化视频审核技术来处理上传的视频,以维持平台的安全与健康。为检测并移除视频分享平台上的仇恨内容,我们的工作聚焦于利用多模态进行仇恨视频检测。为此,我们从 BitChute 上整理约 43 小时视频,手动标注为仇恨或非仇恨,并标出可解释标注决策的帧区间。为收集相关视频,我们利用仇恨词典中的搜索关键词。我们观察到仇恨视频的图像与音频中存在多种线索。此外,我们构建深度学习多模态模型对仇恨视频进行分类,并观察到使用视频的全部模态可使整体仇恨言论检测性能(准确率=0.798,宏 F1 分数=0.790)较最佳单模态模型在宏 F1 分数上提升约 5.7%。总之,我们的工作朝着理解与建模 BitChute 等视频托管平台上的仇恨视频迈出了第一步。

关键词

引用

@article{arxiv.2305.03915,
  title  = {HateMM: A Multi-Modal Dataset for Hate Video Classification},
  author = {Mithun Das and Rohit Raj and Punyajoy Saha and Binny Mathew and Manish Gupta and Animesh Mukherjee},
  journal= {arXiv preprint arXiv:2305.03915},
  year   = {2023}
}

备注

Accepted at ICWSM 2023(dataset track)