揭示多模态仇恨视频分类中的时序标签噪声
计算机视觉与模式识别
2025-08-08 v1 人工智能
摘要
在线多媒体内容的快速扩散加剧了仇恨言论的传播,带来了严重的社会问题和监管挑战。虽然近期研究推动了多模态仇恨视频检测,但大多数方法依赖粗糙的视频级标注,忽略了仇恨内容的时序细粒度,导致标签噪声显著增加。许多标注为仇恨的视频常包含较长的非仇恨时段。本文通过细粒度方法探讨此类标签模糊的影响。具体而言,我们利用标注的时间戳将来自 HateMM 和 MultiHateClip 英文数据集中的仇恨视频裁剪为显式仇恨时段。随后,对这些裁剪后的时段进行探索性分析,考察仇恨与非仇恨内容的分布与特征。分析结果显示,粗糙视频级标注导致的语义重叠程度和标签引入的混淆。最终,通过受控实验表明,时间戳噪声根本性地改变模型决策边界并削弱分类置信度,凸显仇恨表达的内在上下文依赖性和时序连续性。我们的发现为多模态仇恨视频的时序动态提供了新见解,突显对提升鲁棒性和可解释性所需的时序感知模型和基准。代码与数据已公开于 https://github.com/Multimodal-Intelligence-Lab-MIL/HatefulVideoLabelNoise。
引用
@article{arxiv.2508.04900,
title = {Revealing Temporal Label Noise in Multimodal Hateful Video Classification},
author = {Shuonan Yang and Tailin Chen and Rahul Singh and Jiangbei Yue and Jianbo Jiao and Zeyu Fu},
journal= {arXiv preprint arXiv:2508.04900},
year = {2025}
}