MultiHateLoc: 面向在线视频中多模态仇恨内容的时序局部化
计算机视觉与模式识别
2026-01-30 v3
摘要
随着 TikTok 和 YouTube 等平台视频内容的快速增长,多模态仇恨言论的传播也日益加剧,损害线索往往在视觉、声学和文本流中呈现缓慢且不成比例的出现。现有研究主要聚焦于视频级别的分类,实际关键任务——时序局部化识别仇恨片段何时出现——尚未得到充分关注。在弱监督环境下,仅有视频级别标签的情况下,静态融合或基于分类的体系结构难以捕捉跨模态和时序动态。这一挑战尤为突出。为此,我们提出 MultiHateLoc,第一个专为弱监督多模态仇恨局部化设计的框架。MultiHateLoc 集成了 (1) 模态感知时序编码器以建模异构序列模式,包括为特征增强量身定制的文本预处理模块; (2) 动态跨模态融合以在每个时刻适应性地强调最具信息性的模态,以及跨模态对比对齐策略以增强多模态特征一致性; (3) 面向视频级别监督的模态感知 MIL 目标。尽管仅依赖粗标签,MultiHateLoc 仍能生成细粒度、可解释的帧级别预测。在 HateMM 和 MultiHateClip 数据集上实验表明,我们的方法在局部化任务上实现了最佳性能。
引用
@article{arxiv.2512.10408,
title = {MultiHateLoc: Towards Temporal Localisation of Multimodal Hate Content in Online Videos},
author = {Qiyue Sun and Tailin Chen and Yinghui Zhang and Yuchen Zhang and Jiangbei Yue and Jianbo Jiao and Zeyu Fu},
journal= {arXiv preprint arXiv:2512.10408},
year = {2026}
}
备注
In Proceedings of the ACM Web Conference 2026 (WWW 2026)