基于自蒸馏的模态感知对比实例学习用于弱监督音视频暴力检测
计算机视觉与模式识别
2022-07-13 v1 多媒体
摘要
弱监督音视频暴力检测旨在利用视频级标签区分包含多模态暴力事件的片段。许多先前工作在早期或中间阶段进行音视频融合与交互,却忽视了弱监督设定下的模态异质性。本文分析了多实例学习(MIL)过程中的模态异步与实例无差异化现象,并进一步探究其对弱监督音视频学习的负面影响。为解决这些问题,我们提出了一种基于自蒸馏的模态感知对比实例学习(MACIL-SD)策略。具体而言,我们利用轻量级双流网络生成音频与视觉包,其中以无监督方式将单模态背景、暴力和正常实例聚类为半包。然后将音频与视觉暴力半包表征组装为正样本对,并将暴力半包与对立模态中的背景和正常实例组合作为对比负样本对。此外,应用自蒸馏模块将单模态视觉知识迁移至音视频模型,从而缓解噪声并缩小单模态与多模态特征间的语义鸿沟。实验表明,我们的框架在大规模XD-Violence数据集上以更低复杂度优于先前方法。结果还证明所提方法可作为插件模块增强其他网络。代码见 https://github.com/JustinYuu/MACIL_SD。
引用
@article{arxiv.2207.05500,
title = {Modality-Aware Contrastive Instance Learning with Self-Distillation for Weakly-Supervised Audio-Visual Violence Detection},
author = {Jiashuo Yu and Jinyu Liu and Ying Cheng and Rui Feng and Yuejie Zhang},
journal= {arXiv preprint arXiv:2207.05500},
year = {2022}
}
备注
ACM MM 2022