双曲空间中弱监督音视频暴力检测的学习
计算机视觉与模式识别
2024-02-14 v3
摘要
近年来,弱监督音视频暴力检测任务受到了相当多的关注。该任务的目标是基于视频级标签在多模态数据中识别暴力片段。尽管该领域取得了进展,先前研究中使用的传统欧几里得神经网络由于特征空间的局限性,难以捕捉高度判别性的表示。为克服此问题,我们提出 HyperVD,一种在双曲空间中学习片段嵌入以提升模型判别力的新框架。我们的框架包含一个用于多模态融合的绕行融合模块,有效缓解音频与视觉信号间的模态不一致性。此外,我们贡献了两个全双曲图卷积网络分支,在双曲空间中挖掘片段间的特征相似性与时间关系。通过在该空间中学习片段表示,框架有效学习了暴力事件与正常事件之间的语义差异。在 XD-Violence 基准上的大量实验表明,我们的方法以显著优势优于最先进的方法。
引用
@article{arxiv.2305.18797,
title = {Learning Weakly Supervised Audio-Visual Violence Detection in Hyperbolic Space},
author = {Xiaogang Peng and Hao Wen and Yikai Luo and Xiao Zhou and Keyang Yu and Ping Yang and Zizhao Wu},
journal= {arXiv preprint arXiv:2305.18797},
year = {2024}
}
备注
11 pages, 12 figures, typos are fixed