面向仇恨视频检测的推理感知多模态融合
计算机视觉与模式识别
2025-12-03 v1 人工智能
摘要
在线视频中的仇恨言论正日益严重威胁数字平台,特别是随着视频内容日益多模态和情境依赖。现有方法常常难以有效融合复杂的语义关系,缺乏理解细腻仇恨内容的能力。为此,我们提出一种创新的推理感知多模态融合 (RAMF) 框架。为解决第一个挑战,我们设计局部-全局语境融合 (LGCF) 以捕获局部显著线索和全局时序结构,提出语义交叉注意 (SCA) 以实现细粒度多模态语义互动。为解决第二个挑战,我们引入对抗推理——一个结构化的三阶段过程,其中视觉-语言模型生成 (i) 客观描述, (ii) 仇恨假设推断, (iii) 非仇恨假设推断——提供补充的语义视角,丰富模型对细腻仇恨意图的情境理解能力。在两个真实世界的仇恨视频数据集上的评估表明,我们的方法实现了稳健的泛化性能,分别在 Macro-F1 和仇恨类别召回率上较 SOTA 方法提升了 3% 和 7%。我们将在匿名期结束后发布代码。
引用
@article{arxiv.2512.02743,
title = {Reasoning-Aware Multimodal Fusion for Hateful Video Detection},
author = {Shuonan Yang and Tailin Chen and Jiangbei Yue and Guangliang Cheng and Jianbo Jiao and Zeyu Fu},
journal= {arXiv preprint arXiv:2512.02743},
year = {2025}
}