中文

通过通道级和模态级融合提升多模态仇恨视频检测

多媒体 2025-05-20 v1 人工智能 计算机视觉与模式识别

摘要

TikTok 和 YouTube 等平台的视频内容快速增长,改变了信息传播方式,也促进了有害内容的传播,尤其是仇恨视频。尽管有大量努力用于对仇恨言论进行检测,但由于仇恨视频往往隐晦,检测仍具挑战性。当前检测方法主要依赖单模态方法,无法充分捕捉不同模态间的互补特征。虽然多模态技术提供了更广泛的视角,但许多方法未能有效整合捕捉识别细微仇恨内容所必需的时序动态和模态间交互。本文提出了 CMFusion,一种利用新颖通道级和模态级融合机制的增强型多模态仇恨视频检测模型。CMFusion 首先使用预训练模型从文本、音频和视频模态中提取特征,然后采用时序跨注意力机制捕捉视频和音频流之间的依赖关系。所得特征随后经过通道级和模态级融合模块,以获得视频的信息丰富表征。我们在真实世界数据集上进行大量实验,证明 CMFusion 在准确率、精确率、召回率和 F1 分数方面显著优于五个广泛使用的基线方法。全面的消融研究和参数分析进一步验证了我们的设计选择,凸显了该模型在检测仇恨视频方面的有效性。源代码将公开发布于 https://github.com/EvelynZ10/cmfusion。

关键词

引用

@article{arxiv.2505.12051,
  title  = {Enhanced Multimodal Hate Video Detection via Channel-wise and Modality-wise Fusion},
  author = {Yinghui Zhang and Tailin Chen and Yuchen Zhang and Zeyu Fu},
  journal= {arXiv preprint arXiv:2505.12051},
  year   = {2025}
}

备注

ICDMW 2024, Github: https://github.com/EvelynZ10/cmfusion